中文

BetterCheck:面向汽车感知系统的VLM安全护栏

计算机视觉与模式识别 2025-07-24 v1

摘要

大语言模型(LLM)正越来越多地被扩展来处理多模态数据,如同时处理文本和视频。它们在理解图像中显示内容方面的卓越表现,超过了专门的神经网络(NN)如Yolo,该网络仅支持精确但非常有限的词汇,即它们能够检测的对象。当不受限制时,LLM尤其是最先进的视觉语言模型(VLM)在描述甚至复杂交通情境方面表现突出。这使它们可能成为汽车感知系统的合适组件,以支持对复杂交通情境或边缘情况的理解。然而,LLM和VLM容易产生幻觉,这意味着它们可能看不到如此脆弱的道路使用者等交通主体,或看到并非现实中存在的交通主体。后者虽然令人不愿望,使得ADAS或自动驾驶系统(ADS)不必要地减慢速度,但前者可能导致ADS做出灾难性的决定。在我们的工作中,我们系统评估了3种最先进VLM在从Waymo开放数据集中抽取的多样化交通情境子集上的性能,以支持为捕获VLM支持感知系统中此类幻觉提供安全护栏。我们观察到,无论是专有或开源VLM,都展现出对图像理解能力的卓越表现,甚至在我们人类有时难以察觉的细节方面也能仔细关注。然而,它们仍然容易在其描述中编造元素,因此需要像BetterCheck这样的幻觉检测策略来缓解这一问题。

关键词

引用

@article{arxiv.2507.17722,
  title  = {BetterCheck: Towards Safeguarding VLMs for Automotive Perception Systems},
  author = {Malsha Ashani Mahawatta Dona and Beatriz Cabrero-Daniel and Yinan Yu and Christian Berger},
  journal= {arXiv preprint arXiv:2507.17722},
  year   = {2025}
}

备注

Accepted in The IEEE International Conference on Intelligent Transportation Systems (ITSC)2025