模式寻求与均值寻求相遇:快速长视频生成
计算机视觉与模式识别
2026-03-02 v1 机器学习
摘要
将视频生成从秒级扩展到分钟级面临一个关键瓶颈:虽然短视频数据丰富且保真度高,但连贯的长视频数据稀缺且局限于狭窄领域。为解决此问题,我们提出了一种训练范式,其中模式寻求与均值寻求相遇,通过解耦扩散变换器基于统一表示将局部保真度与长期连贯性解耦。我们的方法利用一个全局流匹配头,通过在长视频上进行监督学习来捕捉叙事结构,同时采用一个局部分布匹配头,通过模式寻求的反向KL散度将滑动窗口与冻结的短视频教师模型对齐。该策略使得能够合成分钟级视频,通过监督流匹配从有限的长视频中学习长程连贯性和运动,同时通过将学生的每个滑动窗口段与冻结的短视频教师模型对齐来继承局部真实感,从而产生一个几步快速长视频生成器。评估表明,我们的方法通过联合改善局部清晰度、运动和长程一致性,有效地弥合了保真度-视野差距。项目网站:https://primecai.github.io/mmm/。
引用
@article{arxiv.2602.24289,
title = {Mode Seeking meets Mean Seeking for Fast Long Video Generation},
author = {Shengqu Cai and Weili Nie and Chao Liu and Julius Berner and Lvmin Zhang and Nanye Ma and Hansheng Chen and Maneesh Agrawala and Leonidas Guibas and Gordon Wetzstein and Arash Vahdat},
journal= {arXiv preprint arXiv:2602.24289},
year = {2026}
}
备注
Project website: https://primecai.github.io/mmm/