中文

别让树林遮蔽了森林:基于注意力的大型视觉语言模型校准

计算机视觉与模式识别 2025-06-03 v2 人工智能

摘要

大型视觉语言模型(LVLMs)在视觉理解和描述方面表现出强大的能力,但常常因归因错误或误导性特征而产生幻觉。我们观察到,LVLMs 在图像标记上不成比例地关注小subset of图像标记——称为盲信标记——这些标记通常与查询无关(例如背景或非目标区域)。我们假设,这种注意力错位在生成幻觉响应方面发挥关键作用。为缓解此问题,我们提出了注意力视觉校准(AvisC),这是一种测试时方法,可动态校准盲信标记的影响,而无需修改底层注意力机制。AvisC 通过分析图像标记上各层注意力分布来识别盲信标记,然后采用对抗解码策略来平衡原始 logits 和盲信标记偏导数 logits 的影响。在包括 POPE、MME 和 AMBER 在内的标准基准测试中进行实验,结果表明 AvisC 有效减少了 LVLMs 中的幻觉现象。

关键词

引用

@article{arxiv.2405.17820,
  title  = {Don't Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Models},
  author = {Sangmin Woo and Donguk Kim and Jaehyuk Jang and Yubin Choi and Changick Kim},
  journal= {arXiv preprint arXiv:2405.17820},
  year   = {2025}
}

备注

ACL 2025 Findings; Project: https://sangminwoo.github.io/AvisC/