中文

OpenDriveVLA:面向面向端到端自动驾驶的大型视觉语言动作模型

计算机视觉与模式识别 2025-11-24 v2

摘要

我们提出了 OpenDriveVLA,这是一个用于端到端自动驾驶的视觉语言动作模型,基于开源大型语言模型构建。OpenDriveVLA 通过利用多模态输入(包括 2D 和 3D 实例感知视觉表征、车辆状态以及语言指令),生成具有空间定位的驾驶动作。为弥合驾驶视觉表征与语言嵌入之间的模态差距,我们引入了分层视觉语言对齐过程,将 2D 和 3D 结构化视觉标记投影到统一的语义空间。此外,我们将结构化智能体环境互动建模融入自回归解码过程,使模型能够捕捉可靠轨迹规划所必需的细粒度空间依赖关系和行为感知动力学。在 nuScenes 数据集上的大量实验表明,OpenDriveVLA 在开放式轨迹规划和驾驶相关问答任务中实现了最佳性能。定性分析进一步说明其遵循高级驾驶指令并在挑战性场景下生成轨迹的能力,凸显了其在下一代端到端自动驾驶中的潜力。

关键词

引用

@article{arxiv.2503.23463,
  title  = {OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model},
  author = {Xingcheng Zhou and Xuyuan Han and Feng Yang and Yunpu Ma and Volker Tresp and Alois Knoll},
  journal= {arXiv preprint arXiv:2503.23463},
  year   = {2025}
}