中文

VLP:面向自动驾驶的视觉语言规划

计算机视觉与模式识别 2024-11-26 v4

摘要

自动驾驶是一项复杂且具有挑战性的任务,旨在通过场景理解与推理实现安全的运动规划。尽管纯视觉自动驾驶方法近期通过增强场景理解取得了显著性能,但仍需解决若干关键问题,包括缺乏推理能力、泛化性能低以及长尾场景。本文提出 VLP,一种新颖的视觉-语言-规划 (Vision-Language-Planning) 框架,利用语言模型弥合语言理解与自动驾驶之间的鸿沟。VLP 通过强化源记忆基础和自动驾驶汽车的上下文理解来增强自动驾驶系统。在具有挑战性的 NuScenes 数据集上,VLP 实现了最先进的端到端规划性能,与之前的最佳方法相比,平均 L2 误差和碰撞率分别降低了 35.9% 和 60.5%。此外,VLP 在具有挑战性的长尾场景中表现出更高的性能,并在面对新的城市环境时展现出强大的泛化能力。

关键词

引用

@article{arxiv.2401.05577,
  title  = {VLP: Vision Language Planning for Autonomous Driving},
  author = {Chenbin Pan and Burhaneddin Yaman and Tommaso Nesti and Abhirup Mallik and Alessandro G Allievi and Senem Velipasalar and Liu Ren},
  journal= {arXiv preprint arXiv:2401.05577},
  year   = {2024}
}

备注

CVPR2024