中文

VaViM 与 VaVAM:通过视频生成模型实现自动驾驶

计算机视觉与模式识别 2025-02-24 v1 人工智能 机器人学

摘要

我们探索了大规模生成式视频模型在自动驾驶中的潜力,引入开源自回归视频模型 VaViM 及其伴随视频-动作模型 VaVAM,以探讨视频预训练如何迁移到真实驾驶场景。VaViM 是一个简单自回归视频模型,通过时空 token 序列预测帧。我们表明它捕获了驾驶场景的语义和动态。VaVAM 视频-动作模型利用 VaViM 学习到的表示,通过模仿学习生成驾驶轨迹。两个模型共同构成完整的感知到动作管线。我们在开放式和封闭环驾驶场景中评估了这些模型,揭示了视频基预训练对自动驾驶具有前景。关键见解包括所学表示的语义丰富性、视频合成规模的优势以及封闭环评估中模型规模、数据与安全指标之间复杂关系。我们在 https://github.com/valeoai/VideoActionModel 发布代码和模型权重。

关键词

引用

@article{arxiv.2502.15672,
  title  = {VaViM and VaVAM: Autonomous Driving through Video Generative Modeling},
  author = {Florent Bartoccioni and Elias Ramzi and Victor Besnier and Shashanka Venkataramanan and Tuan-Hung Vu and Yihong Xu and Loick Chambon and Spyros Gidaris and Serkan Odabas and David Hurych and Renaud Marlet and Alexandre Boulch and Mickael Chen and Éloi Zablocki and Andrei Bursuc and Eduardo Valle and Matthieu Cord},
  journal= {arXiv preprint arXiv:2502.15672},
  year   = {2025}
}

备注

Code and model: https://github.com/valeoai/VideoActionModel, project page: https://valeoai.github.io/vavim-vavam/