DriveVLM:自动驾驶与大视觉语言模型的融合
计算机视觉与模式识别
2024-06-26 v5
摘要
城市环境中自动驾驶的主要障碍是理解复杂和长尾场景,例如具有挑战性的路况和微妙的人类行为。我们推出了 DriveVLM,这是一个利用视觉语言模型 (VLMs) 增强场景理解和规划能力的自动驾驶系统。DriveVLM 集成了用于场景描述、场景分析和分层规划的独特推理模块组合。此外,认识到 VLMs 在空间推理方面的局限性及其沉重的计算需求,我们提出了 DriveVLM-Dual,这是一种混合系统,协同了 DriveVLM 与传统自动驾驶流程的优势。在 nuScenes 数据集和我们自建的 SUP-AD 数据集上的实验证明了 DriveVLM 和 DriveVLM-Dual 在处理复杂和不可预测驾驶条件方面的有效性。最后,我们将 DriveVLM-Dual 部署在生产车辆上,验证了其在真实世界自动驾驶环境中的有效性。
引用
@article{arxiv.2402.12289,
title = {DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models},
author = {Xiaoyu Tian and Junru Gu and Bailin Li and Yicheng Liu and Yang Wang and Zhiyong Zhao and Kun Zhan and Peng Jia and Xianpeng Lang and Hang Zhao},
journal= {arXiv preprint arXiv:2402.12289},
year = {2024}
}
备注
Project Page: https://tsinghua-mars-lab.github.io/DriveVLM/