CausalCine:用于多镜头视频叙事的实时自回归生成
计算机视觉与模式识别
2026-05-13 v1
摘要
自回归视频生成旨在实现实时、开放式的合成。然而,电影叙事不仅仅是单场景的无限延伸,而是需要通过不断演变的事件、视角变化和离散的镜头边界来推进。现有的自回归模型在这一设置下往往难以应对。主要为短期预测训练的模型将长序列视为延伸的单帧,必然会在长时间滚动期间出现运动停滞和语义漂移。为弥合这一差距,我们引入CausalCine,一个交互式自回归框架,将多镜头视频生成转化为在线导演过程。CausalCine跨镜头变更进行因果生成,能够动态接受提示,并能在不重新生成前几帧的前提下复用上下文。为实现这一目标,我们首先在原生多镜头序列上训练因果基础模型,以学习复杂的镜头转换。随后,我们提出了内容感知记忆路由(Content-Aware Memory Routing, CAMR),该方法根据注意力相关性得分而非时间相邻性动态检索历史键值条目,在受限的活跃内存下保持跨镜头一致性。最后,我们将因果基础模型蒸馏为少步生成器,以实现实时交互式生成。广泛的实验表明,CausalCine在自回归基线之上显著优越,同时接近双向模型的能力, unlocks了因果生成的流式交互性。演示可在 https://yihao-meng.github.io/CausalCine/ 查看。
引用
@article{arxiv.2605.12496,
title = {CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives},
author = {Yihao Meng and Zichen Liu and Hao Ouyang and Qiuyu Wang and Ka Leong Cheng and Yue Yu and Hanlin Wang and Haobo Li and Jiapeng Zhu and Yanhong Zeng and Xing Zhu and Yujun Shen and Qifeng Chen and Huamin Qu},
journal= {arXiv preprint arXiv:2605.12496},
year = {2026}
}
备注
Project page: https://yihao-meng.github.io/CausalCine/