中文

ARCON:推进自动递推驱动视频生成

计算机视觉与模式识别 2025-02-27 v3

摘要

最近的自动递推大型语言模型(LLM)在视频生成方面取得了显著进展。本文探讨了大型视觉模型(LVM)用于视频续写,这是构建世界模型和预测未来帧的关键任务。我们引入ARCON方案,通过交替生成语义和RGB标记,使LVM能够显式学习高层次结构视频信息。我们发现,在不采用特殊设计的情况下,生成的RGB图像和语义图之间的一致性很高。此外,我们采用基于光流的纹理拼接方法来增强视觉质量。在自动驾驶场景下的实验表明,我们的模型能够持续生成长视频。

关键词

引用

@article{arxiv.2412.03758,
  title  = {ARCON: Advancing Auto-Regressive Continuation for Driving Videos},
  author = {Ruibo Ming and Jingwei Wu and Zhewei Huang and Zhuoxuan Ju and Jianming HU and Lihui Peng and Shuchang Zhou},
  journal= {arXiv preprint arXiv:2412.03758},
  year   = {2025}
}