MAGI-1:大规模自回归视频生成
计算机视觉与模式识别
2025-05-20 v1 人工智能
摘要
我们提出了 MAGI-1,这是一个通过自回归方式预测视频块序列的世界模型,其中视频块定义为固定长度的连续帧序列。经过训练以对每个视频块的噪声进行去噪,该噪声随时间单调增加,MAGI-1 实现了因果的时间建模,并自然支持流式生成。它在以文本指令为条件的图像到视频(I2V)任务中取得优异成绩,展现出高时序一致性和可扩展性,这些性能均得益于若干算法创新和专用的基础设施堆栈。MAGI-1 通过块级提示实现可控生成,并通过保持峰值推理成本恒定,支持实时且内存高效的部署,无论视频长度如何。MAGI-1 最大变体包含 240 亿参数,支持最长 400 万 token 的上下文长度,展示了该方法的可扩展性和鲁健性。代码和模型均已开源发布:https://github.com/SandAI-org/MAGI-1 和 https://github.com/SandAI-org/MagiAttention。产品可在 https://sand.ai 访问。
引用
@article{arxiv.2505.13211,
title = {MAGI-1: Autoregressive Video Generation at Scale},
author = {Sand. ai and Hansi Teng and Hongyu Jia and Lei Sun and Lingzhi Li and Maolin Li and Mingqiu Tang and Shuai Han and Tianning Zhang and W. Q. Zhang and Weifeng Luo and Xiaoyang Kang and Yuchen Sun and Yue Cao and Yunpeng Huang and Yutong Lin and Yuxin Fang and Zewei Tao and Zheng Zhang and Zhongshu Wang and Zixun Liu and Dai Shi and Guoli Su and Hanwen Sun and Hong Pan and Jie Wang and Jiexin Sheng and Min Cui and Min Hu and Ming Yan and Shucheng Yin and Siran Zhang and Tingting Liu and Xianping Yin and Xiaoyu Yang and Xin Song and Xuan Hu and Yankai Zhang and Yuqiao Li},
journal= {arXiv preprint arXiv:2505.13211},
year = {2025}
}