基于宏观-微观规划的高质量并行自回归长视频生成
计算机视觉与模式识别
2025-10-15 v3
摘要
当前自回归扩散模型在视频生成方面表现优异,但通常仅限于短时间尺度。我们的理论分析表明,自回归建模通常因误差累积而导致时间漂移,并阻碍了长视频合成的并行化。为解决这些限制,我们提出了一种以宏观-微观规划 (Macro-from-Micro Planning, MMPL) 为核心的新型规划-填充框架,用于长视频生成。MMPL 通过两个层次阶段构建整个视频的全局情节:首先是微观规划,其预测每个短视频片段内未来稀疏的关键帧集合,提供运动和外观先验,以指导高质量视频片段生成;其次是宏观规划,将微观规划跨视频片段延伸,通过自回归链条实现,从而确保视频片段之间长期一致性。随后,MMPL 基于的内容填充在片段之间并行生成所有中间帧,实现了自回归生成的高效并行化。进一步通过自适应负载调度实现 GPU 执行的平衡,加速自回归视频生成。广泛的实验表明,我们的方法在质量和稳定性方面优于现有的长视频生成模型。生成的视频及比较结果可在我们的项目页面查看。
引用
@article{arxiv.2508.03334,
title = {Macro-from-Micro Planning for High-Quality and Parallelized Autoregressive Long Video Generation},
author = {Xunzhi Xiang and Yabo Chen and Guiyu Zhang and Zhongyu Wang and Zhe Gao and Quanming Xiang and Gonghu Shang and Junqi Liu and Haibin Huang and Yang Gao and Chi Zhang and Qi Fan and Xuelong Li},
journal= {arXiv preprint arXiv:2508.03334},
year = {2025}
}