幻觉图像Token:一种无需训练的EAZY方法用于检测和缓解LVLM中的目标幻觉
计算机视觉与模式识别
2025-07-08 v2 机器学习
摘要
尽管具有显著潜力,大视觉语言模型(LVLM)仍然面临目标幻觉问题,即其生成的输出错误地包含了实际上不存在的对象。虽然大多数工作侧重于在语言模型主干内解决此问题,但我们的工作将重点转向图像输入源,研究特定的图像Token如何导致幻觉。我们的分析揭示了一个引人注目的发现:具有高注意力分数的一小部分图像Token是目标幻觉的主要驱动因素。通过移除这些幻觉图像Token(仅占所有图像Token的 1.5%),可以有效缓解此问题。这一发现在不同模型和数据集上保持一致。基于这一洞察,我们引入了 EAZY,一种新颖的、无需训练的方法,通过将幻觉图像Token归零来自动识别和消除幻觉。我们利用 EAZY 进行无监督目标幻觉检测,与先前方法相比实现了 15% 的提升。此外,EAZY 在保持模型效用的同时展现出显著的幻觉缓解效果,并能无缝适应各种 LVLM 架构。
引用
@article{arxiv.2503.07772,
title = {Hallucinatory Image Tokens: A Training-free EAZY Approach on Detecting and Mitigating Object Hallucinations in LVLMs},
author = {Liwei Che and Tony Qingze Liu and Jing Jia and Weiyi Qin and Ruixiang Tang and Vladimir Pavlovic},
journal= {arXiv preprint arXiv:2503.07772},
year = {2025}
}
备注
Accepted to ICCV2025