DASH:面向视觉语言模型的系统性幻觉检测与评估
计算机视觉与模式识别
2025-04-01 v1 人工智能
机器学习
摘要
视觉语言模型 (VLM) 容易产生对象幻觉,即错误地指示图像中存在某些对象。现有基准使用相对较小的标记数据集来量化幻觉。然而,这种方法(i) 不足以评估在开放世界环境中发生的幻觉,VLM 在此类环境中广泛使用;(ii) 不足以检测 VLM 的系统性错误。我们提出了 DASH (Detection and Assessment of Systematic Hallucinations),一个自动化、大规模的管道,旨在识别 VLM 在开放世界环境中实时图像的系统性幻觉。其关键组件是 DASH-OPT 用于图像检索,通过在“自然图像流形”上进行优化来生成误导 VLM 的图像。DASH 的输出包括 VLM 对哪些真实且语义相似的图像组检测到对象幻觉的聚类。我们将 DASH 应用于 PaliGemma 和两个 LLaVA-NeXT 模型,跨 380 个对象类别,总计发现超过 19000 个聚类,涉及 95 万张图像。我们研究了识别的系统性幻觉对其他 VLM 的迁移情况,表明使用 DASH 获取的模型特定图像进行微调可缓解对象幻觉。代码和数据已公开于 https://YanNeu.github.io/DASH。
引用
@article{arxiv.2503.23573,
title = {DASH: Detection and Assessment of Systematic Hallucinations of VLMs},
author = {Maximilian Augustin and Yannic Neuhaus and Matthias Hein},
journal= {arXiv preprint arXiv:2503.23573},
year = {2025}
}