视频生成的长上下文调优
计算机视觉与模式识别
2025-03-14 v1
摘要
近期视频生成进展可通过可扩展扩散 Transformer 产生逼真的单镜头分钟级视频. 然而,真实世界的叙事视频需要具有跨镜头视觉和动态一致性的多镜头场景. 在此工作中,我们引入了长上下文调优(LCT),一种训练范式,将预训练单镜头视频扩散模型的上下文窗口扩展,以直接从数据中学习场景级一致性. 我们的方法将全注意力机制从单个镜头扩展到涵盖场景内的所有镜头,结合交错的三维位置编码和异步噪声策略,实现无额外参数的联合和自回归镜头生成. 经 LCT 后具有双向注意力的模型可进一步使用上下文因果注意力进行微调,促进高效 KV-cache 的自回归生成. 实验表明,LCT 后的单镜头模型可生成连贯的多镜头场景,并展现出涌现能力,包括组合式生成和交互式镜头扩展,为更实用的视觉内容创作铺平道路. 详见 https://guoyww.github.io/projects/long-context-video/.
引用
@article{arxiv.2503.10589,
title = {Long Context Tuning for Video Generation},
author = {Yuwei Guo and Ceyuan Yang and Ziyan Yang and Zhibei Ma and Zhijie Lin and Zhenheng Yang and Dahua Lin and Lu Jiang},
journal= {arXiv preprint arXiv:2503.10589},
year = {2025}
}
备注
Project Page: https://guoyww.github.io/projects/long-context-video/