大视觉语言模型中对象幻觉的视觉标记认知不确定性
计算机视觉与模式识别
2025-10-13 v1 人工智能
计算与语言
摘要
大视觉语言模型(LVLMs)将视觉编码器(VE)与大语言模型相结合,在各种任务上取得了显著成功。然而,LVLMs仍存在关键挑战,如对象幻觉——生成输入图像中不存在的对象的描述。在这里,我们论证了VE中不确定的视觉标记是导致对象幻觉的关键因素。我们的统计分析发现,具有高认知不确定性的视觉标记与幻觉的发生之间存在正相关关系。此外,我们从理论和实证上表明,在VE早期层中表现出大表示偏差、对小对抗扰动敏感的视觉标记表明高认知不确定性。基于这些发现,我们提出了一种简单而有效的策略,通过仅修改VE来缓解对象幻觉。我们的方法包括一种利用对抗扰动高效识别不确定视觉标记的代理方法,以及一种在VE中间层的自注意力过程中屏蔽这些不确定视觉标记的方法,抑制它们对视觉编码的影响,从而减轻幻觉。大量实验表明,我们的方法显著减少了LVLMs中的对象幻觉,并且可以与先前工作协同运作。
引用
@article{arxiv.2510.09008,
title = {On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models},
author = {Hoigi Seo and Dong Un Kang and Hyunjin Cho and Joohoon Lee and Se Young Chun},
journal= {arXiv preprint arXiv:2510.09008},
year = {2025}
}