中文

DriveLM:基于图视觉问答的驾驶

计算机视觉与模式识别 2025-01-17 v3

摘要

我们研究了如何将基于网络规模数据训练的视觉 - 语言模型(VLMs)集成到端到端驾驶系统中,以增强泛化能力并实现与人类用户的交互。虽然最近的方法通过单轮视觉问答(VQA)使 VLMs 适应驾驶,但人类驾驶员是多步推理决策的。从关键物体的定位开始,人类在采取行动之前会估计物体间的相互作用。关键见解在于,通过我们提出的任务——图视觉问答(Graph VQA),即通过感知、预测和规划的问答对来建模图结构推理,我们获得了一个适合模仿人类推理过程的代理任务。我们实例化了基于 nuScenes 和 CARLA 构建的数据集(DriveLM-Data),并提出了一种基于 VLM 的基线方法(DriveLM-Agent),用于联合执行图视觉问答和端到端驾驶。实验表明,图视觉问答为推理驾驶场景提供了一个简单且原则性的框架,而 DriveLM-Data 为该任务提供了一个具有挑战性的基准。我们的 DriveLM-Agent 基线在端到端自动驾驶方面的表现与最先进的特定驾驶架构相比具有竞争力。值得注意的是,当在未见过的物体或传感器配置上进行零样本评估时,其优势尤为明显。我们希望这项工作能成为应用 VLMs 于自动驾驶的新起点。为了促进未来的研究,所有代码、数据和模型均向公众开放。

关键词

引用

@article{arxiv.2312.14150,
  title  = {DriveLM: Driving with Graph Visual Question Answering},
  author = {Chonghao Sima and Katrin Renz and Kashyap Chitta and Li Chen and Hanxue Zhang and Chengen Xie and Jens Beißwenger and Ping Luo and Andreas Geiger and Hongyang Li},
  journal= {arXiv preprint arXiv:2312.14150},
  year   = {2025}
}

备注

Accepted to ECCV 2024 as Oral paper