中文

评估与增强 LLM 在感知任务中的可信度

计算机视觉与模式识别 2024-08-06 v1 新兴技术

摘要

今天的先进驾驶辅助系统(ADAS),如自适应巡航控制或后碰撞警报,正在跨越车辆类别广泛采用。将这类先进且多模态的大型语言模型(LLM)集成到车辆上,能够处理文本、图像、音频和其他数据类型,可能大幅提升乘客舒适度。然而,LLM 的幻觉仍是亟待解决的主要挑战。本文系统评估了针对 LLM 在基于视觉数据中对象检测情境下(以行人检测和定位为例)的潜在幻觉检测策略。我们对两种最先进 LLM(专有 GPT-4V 和开源 LLaVA)应用三个幻觉检测策略,在两个数据集(Waymo/US 和 PREPER CITY/Sweden)上进行评估。我们的结果表明,这些 LLM 能够以惊人的细节描述交通情景,但在进一步分析活动(如对象定位)方面仍面临挑战。我们评估并扩展了幻觉检测方法,以应用于基于视频序列的行人检测。我们的实验表明,目前最先进的专有 LLM 在开源 LLM 方面表现出色。此外,基于投票的一致性增强技术(如最佳三选(BO3)方法)在那些倾向于以高假阴性检测行人的 LLM 中并不有效地减少幻觉。然而,扩展幻觉检测以包括过去的信息有助于改善结果。

关键词

引用

@article{arxiv.2408.01433,
  title  = {Evaluating and Enhancing Trustworthiness of LLMs in Perception Tasks},
  author = {Malsha Ashani Mahawatta Dona and Beatriz Cabrero-Daniel and Yinan Yu and Christian Berger},
  journal= {arXiv preprint arXiv:2408.01433},
  year   = {2024}
}

备注

Accepted in 27th IEEE International Conference on Intelligent Transportation Systems (ITSC) 2024