ARCON:推进自动递推驱动视频生成
计算机视觉与模式识别
2025-02-27 v3
摘要
最近的自动递推大型语言模型(LLM)在视频生成方面取得了显著进展。本文探讨了大型视觉模型(LVM)用于视频续写,这是构建世界模型和预测未来帧的关键任务。我们引入ARCON方案,通过交替生成语义和RGB标记,使LVM能够显式学习高层次结构视频信息。我们发现,在不采用特殊设计的情况下,生成的RGB图像和语义图之间的一致性很高。此外,我们采用基于光流的纹理拼接方法来增强视觉质量。在自动驾驶场景下的实验表明,我们的模型能够持续生成长视频。
引用
@article{arxiv.2412.03758,
title = {ARCON: Advancing Auto-Regressive Continuation for Driving Videos},
author = {Ruibo Ming and Jingwei Wu and Zhewei Huang and Zhuoxuan Ju and Jianming HU and Lihui Peng and Shuchang Zhou},
journal= {arXiv preprint arXiv:2412.03758},
year = {2025}
}