中文

LLMs 通过自我检查以缓解交通理解任务中的幻觉现象

计算机视觉与模式识别 2024-09-20 v1

摘要

当今的大型语言模型 (LLMs) 已展现出从简单文本生成到高级图像处理等卓越能力。由于能够处理多模态数据,LLMs 正在被探索用于车载服务,如支援自动驾驶系统中高级车辆辅助系统 (ADAS) 的感知任务。然而,LLMs 常生成无意义或不忠实的信息,称为“幻觉”,这一问题亟需缓解。本文系统性地探讨了将 SelfCheckGPT 用于检测两种来源(美国 Waymo Open Dataset 和来自瑞典的 PREPER CITY 数据集)的车辆视觉数据的幻觉。我们的结果表明,GPT-4o 在生成忠实的图像描述方面优于 LLaVA,后者在将非幻觉内容误标记为幻觉方面较为宽松。此外,性能指标分析显示,数据集类型 (Waymo 或 PREPER CITY) 对图像描述质量或幻觉检测效果影响不大。然而,模型在白天捕获的图像上表现优于黎明、黄昏或夜间的图像。总体而言,结果表明 SelfCheckGPT 及其改编可用于过滤生成的交通相关图像描述中的幻觉。

关键词

引用

@article{arxiv.2409.12580,
  title  = {LLMs Can Check Their Own Results to Mitigate Hallucinations in Traffic Understanding Tasks},
  author = {Malsha Ashani Mahawatta Dona and Beatriz Cabrero-Daniel and Yinan Yu and Christian Berger},
  journal= {arXiv preprint arXiv:2409.12580},
  year   = {2024}
}

备注

ICTSS 2024, 36th International Conference on Testing Software and Systems