中文

WiseAD:基于视觉语言模型的知识增强端到端自动驾驶

计算机视觉与模式识别 2024-12-18 v2

摘要

视觉语言模型(VLM)在快速发展中展现出强大的常识和逻辑推理能力,这推动了将其应用于高级自动驾驶任务(如场景理解和决策)的兴趣日益增长。然而,针对知识熟练度(尤其是关键驾驶 expertise)与闭环自动驾驶绩效之间关系进行深入研究仍有待探索。本文我们研究了驾驶知识深度和广度对闭环轨迹规划的影响,介绍了WiseAD——一个专为端到端自动驾驶设计的 VLM,具备推理、行动解释、目标识别、风险分析、驾驶建议和跨场景轨迹规划能力。我们采用驾驶知识与规划数据集联合训练,使模型能够根据知识进行轨迹规划。大量实验表明,随着驾驶知识的多样性提升,关键事故显著减少,在Carla闭环评估中,驾驶得分和路径完成率分别提升了11.9%和12.4%,实现了最先进的性能。此外,WiseAD在多个领域和跨领域数据集上的知识评估也表现出色。

关键词

引用

@article{arxiv.2412.09951,
  title  = {WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model},
  author = {Songyan Zhang and Wenhui Huang and Zihui Gao and Hao Chen and Chen Lv},
  journal= {arXiv preprint arXiv:2412.09951},
  year   = {2024}
}