中文

VLMs是否准备好用于自动驾驶?从可靠性、数据和指标的实证研究

计算机视觉与模式识别 2025-01-08 v1 机器人学

摘要

近期视觉语言模型(VLMs)的进展引发了对其在自动驾驶中应用的兴趣,尤其是通过自然语言生成可解释的驾驶决策。然而,关于VLMs是否天然提供视觉锚定、可靠且可解释的驾驶解释的假设尚未得到充分检验。为填补这一空白,我们引入DriveBench基准数据集,旨在评估VLMs在17种设置(干净、损坏和仅文本输入)下的可靠性,涵盖19,200个帧、20,498个问答对、三种问题类型、四种主流驾驶任务,以及12个流行VLMs。我们的发现表明,VLMs往往会生成来自一般知识或文本线索的合理回应,而非真正的视觉锚定,尤其是在退化或缺失视觉输入的情况下。这一行为被数据失衡和不充分的评估指标所掩盖,在自动驾驶等安全关键场景中构成重大风险。我们进一步观察到VLMs在多模态推理方面存在困难,并对输入损坏表现出 heightened sensitivity,导致性能不一致。为此,我们提出了细化后的评估指标,优先考虑稳健的视觉锚定和多模态理解。此外,我们突出了利用VLMs对损坏程度的意识来提升其可靠性的潜力,为开发在真实世界自动驾驶情境中更可信、更可解释的决策系统提供了道路图。该基准工具包已公开提供。

关键词

引用

@article{arxiv.2501.04003,
  title  = {Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives},
  author = {Shaoyuan Xie and Lingdong Kong and Yuhao Dong and Chonghao Sima and Wenwei Zhang and Qi Alfred Chen and Ziwei Liu and Liang Pan},
  journal= {arXiv preprint arXiv:2501.04003},
  year   = {2025}
}

备注

Preprint; 41 pages, 32 figures, 16 tables; Project Page at https://drive-bench.github.io/