中文

幻觉图像Token:一种无需训练的EAZY方法用于检测和缓解LVLM中的目标幻觉

计算机视觉与模式识别 2025-07-08 v2 机器学习

摘要

尽管具有显著潜力,大视觉语言模型(LVLM)仍然面临目标幻觉问题,即其生成的输出错误地包含了实际上不存在的对象。虽然大多数工作侧重于在语言模型主干内解决此问题,但我们的工作将重点转向图像输入源,研究特定的图像Token如何导致幻觉。我们的分析揭示了一个引人注目的发现:具有高注意力分数的一小部分图像Token是目标幻觉的主要驱动因素。通过移除这些幻觉图像Token(仅占所有图像Token的 1.5%),可以有效缓解此问题。这一发现在不同模型和数据集上保持一致。基于这一洞察,我们引入了 EAZY,一种新颖的、无需训练的方法,通过将幻觉图像Token归零来自动识别和消除幻觉。我们利用 EAZY 进行无监督目标幻觉检测,与先前方法相比实现了 15% 的提升。此外,EAZY 在保持模型效用的同时展现出显著的幻觉缓解效果,并能无缝适应各种 LVLM 架构。

关键词

引用

@article{arxiv.2503.07772,
  title  = {Hallucinatory Image Tokens: A Training-free EAZY Approach on Detecting and Mitigating Object Hallucinations in LVLMs},
  author = {Liwei Che and Tony Qingze Liu and Jing Jia and Weiyi Qin and Ruixiang Tang and Vladimir Pavlovic},
  journal= {arXiv preprint arXiv:2503.07772},
  year   = {2025}
}

备注

Accepted to ICCV2025