视觉语言模型在自动驾驶中的应用:综述与展望
计算机视觉与模式识别
2024-06-25 v2 人工智能
摘要
视觉语言模型(VLM)在自动驾驶(AD)领域的应用因其卓越的性能以及利用大语言模型(LLM)的能力而受到广泛关注。通过引入语言数据,驾驶系统能够更好地理解真实世界环境,从而提升驾驶安全性与效率。本文对该领域中视觉语言模型的进展进行了全面而系统的综述,涵盖感知与理解、导航与规划、决策与控制、端到端自动驾驶以及数据生成。我们介绍了自动驾驶中主流的VLM任务以及常用的评价指标。此外,我们回顾了各领域的当前研究与应用,并全面总结了现有的语言增强自动驾驶数据集。最后,我们讨论了VLM在自动驾驶中的优势与挑战,并为研究者提供了当前的研究空白与未来趋势。
引用
@article{arxiv.2310.14414,
title = {Vision Language Models in Autonomous Driving: A Survey and Outlook},
author = {Xingcheng Zhou and Mingyu Liu and Ekim Yurtsever and Bare Luka Zagar and Walter Zimmer and Hu Cao and Alois C. Knoll},
journal= {arXiv preprint arXiv:2310.14414},
year = {2024}
}