LoL:比更长还长,将视频生成扩展到小时级
计算机视觉与模式识别
2026-01-26 v1 人工智能
摘要
近期长视频生成的研究已从双向模型转向自回归模型,但这些方法普遍存在误差累积和长期连贯性丧失的问题。虽然引入了注意力汇聚帧来缓解这种性能衰减,但它们常常引发一种我们称之为汇聚崩溃的关键失效模式:生成内容反复回归到汇聚帧,导致场景突然重置和循环运动模式。我们的分析揭示,汇聚崩溃源于旋转位置编码(RoPE)的周期结构与当前生成模型中普遍存在的多头注意力机制之间的内在冲突。为了解决这个问题,我们提出了一种轻量级、无需训练的方法,通过引入多头RoPE抖动来打破头间注意力同质化并缓解长期崩溃,从而有效抑制这种行为。大量实验表明,我们的方法在保持生成质量的同时成功缓解了汇聚崩溃。据我们所知,这项工作首次实现了几乎没有质量衰减的实时、流式、无限长度视频生成。作为这种鲁棒性的例证,我们生成了长达12小时的连续视频,据我们所知,这是在流式视频生成中公开演示的最长结果之一。
引用
@article{arxiv.2601.16914,
title = {LoL: Longer than Longer, Scaling Video Generation to Hour},
author = {Justin Cui and Jie Wu and Ming Li and Tao Yang and Xiaojie Li and Rui Wang and Andrew Bai and Yuanhao Ban and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:2601.16914},
year = {2026}
}
备注
preprint