中文

视觉语言模型在自动驾驶中的应用:综述与展望

计算机视觉与模式识别 2024-06-25 v2 人工智能

摘要

视觉语言模型(VLM)在自动驾驶(AD)领域的应用因其卓越的性能以及利用大语言模型(LLM)的能力而受到广泛关注。通过引入语言数据,驾驶系统能够更好地理解真实世界环境,从而提升驾驶安全性与效率。本文对该领域中视觉语言模型的进展进行了全面而系统的综述,涵盖感知与理解、导航与规划、决策与控制、端到端自动驾驶以及数据生成。我们介绍了自动驾驶中主流的VLM任务以及常用的评价指标。此外,我们回顾了各领域的当前研究与应用,并全面总结了现有的语言增强自动驾驶数据集。最后,我们讨论了VLM在自动驾驶中的优势与挑战,并为研究者提供了当前的研究空白与未来趋势。

关键词

引用

@article{arxiv.2310.14414,
  title  = {Vision Language Models in Autonomous Driving: A Survey and Outlook},
  author = {Xingcheng Zhou and Mingyu Liu and Ekim Yurtsever and Bare Luka Zagar and Walter Zimmer and Hu Cao and Alois C. Knoll},
  journal= {arXiv preprint arXiv:2310.14414},
  year   = {2024}
}