中文

DriveVLM:自动驾驶与大视觉语言模型的融合

计算机视觉与模式识别 2024-06-26 v5

摘要

城市环境中自动驾驶的主要障碍是理解复杂和长尾场景,例如具有挑战性的路况和微妙的人类行为。我们推出了 DriveVLM,这是一个利用视觉语言模型 (VLMs) 增强场景理解和规划能力的自动驾驶系统。DriveVLM 集成了用于场景描述、场景分析和分层规划的独特推理模块组合。此外,认识到 VLMs 在空间推理方面的局限性及其沉重的计算需求,我们提出了 DriveVLM-Dual,这是一种混合系统,协同了 DriveVLM 与传统自动驾驶流程的优势。在 nuScenes 数据集和我们自建的 SUP-AD 数据集上的实验证明了 DriveVLM 和 DriveVLM-Dual 在处理复杂和不可预测驾驶条件方面的有效性。最后,我们将 DriveVLM-Dual 部署在生产车辆上,验证了其在真实世界自动驾驶环境中的有效性。

关键词

引用

@article{arxiv.2402.12289,
  title  = {DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models},
  author = {Xiaoyu Tian and Junru Gu and Bailin Li and Yicheng Liu and Yang Wang and Zhiyong Zhao and Kun Zhan and Peng Jia and Xianpeng Lang and Hang Zhao},
  journal= {arXiv preprint arXiv:2402.12289},
  year   = {2024}
}

备注

Project Page: https://tsinghua-mars-lab.github.io/DriveVLM/