超越帧级预测的自回归视频生成
计算机视觉与模式识别
2025-09-30 v1
摘要
自回归视频生成模型通常按帧进行, 将语言中的下一个词预测扩展到视频的时序维度。我们质疑,与语言中词作为通用令牌不同,帧是否是合适的预测单元。为此,我们提出了 VideoAR 框架,支持包括完整帧、关键细节帧、多尺度细化和时空体积在内的多种预测单元。其中,利用作为预测单元的时空体积进行视频生成的模型设计表现最佳,这使自回归模型能够同时在空间和时间维度上进行操作。该方法消除了帧是视频自回归天然原子单元的假设。我们在多样化的预测策略上评估了 VideoAR,发现基于体积的预测在质量、速度和时序连贯性方面始终优于其他方法。通过消除帧级约束,我们的视频生成器在 VBench 上超越了最先进的基线,推理更快,能够无缝扩展到分钟级序列。我们希望本工作将激发人们重新思考视频及其他时空领域的序列分解方式。
引用
@article{arxiv.2509.24081,
title = {Autoregressive Video Generation beyond Next Frames Prediction},
author = {Sucheng Ren and Chen Chen and Zhenbang Wang and Liangchen Song and Xiangxin Zhu and Alan Yuille and Yinfei Yang and Jiasen Lu},
journal= {arXiv preprint arXiv:2509.24081},
year = {2025}
}