中文

VLM-AD:通过视觉语言模型监督实现端到端自动驾驶

计算机视觉与模式识别 2025-09-03 v2 机器学习

摘要

人类驾驶员依赖常识推理来应对多样且动态的真实世界场景。现有的端到端(E2E)自动驾驶(AD)模型通常被优化为模仿数据中观察到的驾驶模式,而未捕捉其背后的推理过程。这一局限性限制了它们处理具有挑战性的驾驶场景的能力。为弥补这一差距,我们提出VLM-AD,一种利用视觉语言模型(VLM)作为教师的方法,通过提供包含非结构化推理信息和结构化动作标签的额外监督来增强训练。这种监督增强了模型学习更丰富特征表示的能力,从而捕捉驾驶模式背后的逻辑。重要的是,我们的方法在推理时不需要VLM,使其适用于实时部署。当与最先进的方法集成时,VLM-AD在nuScenes数据集上实现了规划准确性的显著提升和碰撞率的降低。它还在闭环评估下进一步提高了路线完成率和驾驶得分,证明了其在长时域、交互式驾驶场景中的有效性及其安全可靠地部署于真实世界的潜力。

关键词

引用

@article{arxiv.2412.14446,
  title  = {VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision},
  author = {Yi Xu and Yuxin Hu and Zaiwei Zhang and Gregory P. Meyer and Siva Karthik Mustikovela and Siddhartha Srinivasa and Eric M. Wolff and Xin Huang},
  journal= {arXiv preprint arXiv:2412.14446},
  year   = {2025}
}

备注

Accepted by CoRL 2025