中文

无需向量量化的自回归视频生成

计算机视觉与模式识别 2025-03-04 v2

摘要

本文提出了一种新颖的方法,能够高效地实现自回归视频生成。我们提出将视频生成问题重新表述为时间上逐帧预测与空间上逐集预测的非量化自回归建模。不同于以往自回归模型中的光栅扫描预测,或扩散模型中对固定长度 token 的联合分布建模,我们的方法在保持 GPT 风格模型的因果属性以实现灵活的上下文能力的同时,在单个帧内利用双向建模以提高效率。基于所提出的方法,我们训练了一个无需向量量化的新型视频自回归模型,称为 NOVA。我们的结果表明,即使模型容量小得多(即 0.6B 参数),NOVA 在数据效率、推理速度、视觉保真度和视频流畅度上均超越了以往的自回归视频模型。NOVA 在文本到图像生成任务中也优于最先进的图像扩散模型,且训练成本显著降低。此外,NOVA 在更长的视频时长上表现出良好的泛化能力,并在一个统一模型中实现了多样化的零样本应用。代码和模型公开于 https://github.com/baaivision/NOVA。

关键词

引用

@article{arxiv.2412.14169,
  title  = {Autoregressive Video Generation without Vector Quantization},
  author = {Haoge Deng and Ting Pan and Haiwen Diao and Zhengxiong Luo and Yufeng Cui and Huchuan Lu and Shiguang Shan and Yonggang Qi and Xinlong Wang},
  journal= {arXiv preprint arXiv:2412.14169},
  year   = {2025}
}

备注

Accepted to ICLR 2025. Project page at https://github.com/baaivision/NOVA