中文

LoViC:基于上下文压缩的高效长视频生成

计算机视觉与模式识别 2025-07-18 v1

摘要

尽管最近在扩散变换器(DiTs)用于文本到视频生成方面取得了进展,但由于自注意力的二次复杂度,扩展到持久内容仍具有挑战性。虽然先前的努力——例如稀疏注意力和时序自回归模型——提供了部分缓解,但往往在时序连贯性或可扩展性方面受到牺牲。我们引入 LoViC,一个基于 DiT 的框架,在百万级开放领域视频上进行训练,旨在通过分段生成过程产生长篇连贯视频。我们方法的核心是 FlexFormer,一种表达型自编码器,能够将视频和文本联合压缩到统一的潜表示中。它支持可线性调整的压缩率的可变长度输入,由基于 Q-Former 架构的单查询标记设计实现。此外,通过位置感知机制编码时序上下文,我们的模型在统一的范式中无缝支持预测、重译、插值和多shot 生成。广泛的实验在多样化任务上验证了我们方法的有效性和多样性。

关键词

引用

@article{arxiv.2507.12952,
  title  = {LoViC: Efficient Long Video Generation with Context Compression},
  author = {Jiaxiu Jiang and Wenbo Li and Jingjing Ren and Yuping Qiu and Yong Guo and Xiaogang Xu and Han Wu and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2507.12952},
  year   = {2025}
}

备注

Project page: https://jiangjiaxiu.github.io/lovic/