MAGI-1 / MAGI-2 Preview 简介

MAGI(Magi-1、Magi-2 Preview):Sand.ai开源的自回归视频生成世界模型,采用视频块(video token block)因果预测,和Diffusion(Vidu、Runway)是两条完全不同的技术路线。

  • MAGI-1:2025年4月开源;提供 24B / 4.5B 两个参数版本
  • MAGI-2 Preview:2026年8月发布,MoE混合专家架构,总参数114B,但每次推理仅激活约6B参数,大幅压低推理成本

✅ 核心原理

传统扩散模型:一次去噪生成整段视频;
MAGI:自回归,逐块预测后续视频片段(类似大模型逐token预测文字)。

  1. 输入:文本 / 图片 / 前一段视频
  2. 模型预测下一个视频块,因果注意力,保证时序一致性
  3. 持续拼接扩展,天然支持无限长视频续写,不会出现长视频角色崩坏问题
  4. MAGI-2:文本+图像+视频+音频统一Transformer建模,一次输出带同步音频的1080P视频

✨ 关键亮点

  1. 长视频一致性强:自回归块生成,擅长维持角色、物体、场景跨长时间不变,是它最大优势;在Physics-IQ物理世界推理榜单长期登顶,物理因果理解很强
  2. MAGI-2成本极低:10秒1080P音视频推理成本约 0.5元人民币,MoE架构做到大模型能力、小模型推理开销,权重可商用开源
  3. 精细时间线控制:支持秒级时间轴指令,对镜头切换、人物动作、场景变化做精确控制,适合影视、短剧分镜制作
  4. 完整开源:模型权重、技术报告开放,支持本地部署、Docker、二次开发;同时提供在线网页API

⚠️ 局限

  1. 自回归逐块生成,生成速度慢于扩散模型(Vidu这类扩散是一次性渲染)
  2. 短镜头静态画面,扩散模型画质上限有时更高;MAGI优势体现在长时序、物理交互、连贯叙事
  3. 显存门槛:24B版本本地跑需要较高显存;4.5B小版本画质会下降

🧩 典型场景

  • 短剧、动画、影视分镜:连续镜头、人物贯穿多段画面
  • 数字人、虚拟场景长序列动态推演
  • 世界模型研究:物理因果、物体交互仿真
  • Agent数字环境:生成可交互连续虚拟场景
免责声明:本网站仅提供网址导航服务,对链接内容不负任何责任或担保。
相关资讯