中文

DriveVA:视频动作模型即为零样本驾驶器

计算机视觉与模式识别 2026-04-07 v1 机器人学

摘要

泛化是自动驾驶的核心挑战,因为实际部署需要在未见情景、传感器域和环境条件下保持稳健性能。最近的基于世界模型的规划方法在场景理解和多模态未来预测方面显示出强大能力,但其在数据集和传感器配置之间的泛化仍受限。此外,其松耦合规划范式常导致视觉想象中的视频-轨迹不一致。为克服这些限制,我们提出 DriveVA,一种新的自动驾驶世界模型,通过共享的潜在生成过程联合解码未来视觉预测和动作序列。DriveVA 继承了来自大规模视频生成模型的丰富运动动力学和物理合理性先验,以捕捉连续时空演化和因果相互作用模式。为此,DriveVA 采用基于 DiT 的解码器联合预测未来动作序列(轨迹)和视频,从而实现规划与场景演化之间的更紧密对齐。我们还引入视频延续策略以强化长期滚动一致性。DriveVA 在 NAVSIM 挑战上实现了 90.9 PDM 分数,展示了其零样本能力和跨域泛化性能,在 nuScenes 上的平均 L2 误差和碰撞率分别降低 78.9% 和 83.3%,在基于 CARLA v2 的 Bench2drive 上的平均 L2 误差和碰撞率分别降低 52.5% 和 52.4%。

关键词

引用

@article{arxiv.2604.04198,
  title  = {DriveVA: Video Action Models are Zero-Shot Drivers},
  author = {Mengmeng Liu and Diankun Zhang and Jiuming Liu and Jianfeng Cui and Hongwei Xie and Guang Chen and Hangjun Ye and Michael Ying Yang and Francesco Nex and Hao Cheng},
  journal= {arXiv preprint arXiv:2604.04198},
  year   = {2026}
}