OpenViGA:基于公开数据整合与微调的汽车驾驶场景视频生成
计算机视觉与模式识别
2025-09-22 v1
摘要
最近成功的视频生成系统通过专门的模型分配 tokenization、未来状态预测(世界模型)和视频解码。这些方法常利用大型模型,需要大量训练资源,设计选择有限,缺乏公开的代码和数据集。本文针对这些不足之处,提出 OpenViGA 用于汽车驾驶场景的开放视频生成系统。我们的贡献包括:不同于 GAIA-1 等早期工作,我们对系统的三个组成部分进行深入的定量和质性评估:图像 tokenizer、世界模型、视频解码器。其次,我们仅基于来自多个领域的强大预训练开源模型,通过公开的汽车数据(BDD100K)在 GPU 硬件上进行微调,实现学术规模。第三,我们通过整合组件接口构建连贯的视频生成系统。第四,由于底层模型和数据公开可用,我们允许完全可复现。最后,我们还在 GitHub 上发布了代码和模型。对于 256x256 大小、4 fps 的图像,我们仅需算法延迟一个帧,就能逐帧预测逼真的驾驶场景视频。
引用
@article{arxiv.2509.15479,
title = {OpenViGA: Video Generation for Automotive Driving Scenes by Streamlining and Fine-Tuning Open Source Models with Public Data},
author = {Björn Möller and Zhengyang Li and Malte Stelzer and Thomas Graave and Fabian Bettels and Muaaz Ataya and Tim Fingscheidt},
journal= {arXiv preprint arXiv:2509.15479},
year = {2025}
}