中文

揭示与增强核心视觉区域:利用内部注意力动态缓解LVLM中的幻觉

计算机视觉与模式识别 2026-02-18 v1

摘要

LVLM已经取得了强大的多模态推理能力,但仍然容易产生幻觉,即输出与视觉输入或用户指令不一致。现有的免训练方法,包括对比解码和辅助专家模型(这会增加数倍的计算开销并可能引入潜在干扰),以及静态内部信号增强,通常容易受到注意力汇聚现象的影响。我们发现,LVLM中的内部正向注意力动态(PAD)在注意力汇聚的扭曲下自然地揭示了语义核心视觉区域。基于此,我们提出了正向注意力动态增强(PADE),这是一种免训练的注意力干预方法,它构建一个PAD图来识别语义核心视觉区域,应用逐头中位数绝对偏差缩放来自适应控制干预强度,并利用系统令牌补偿来维持对复杂用户指令的注意力并支持长期输出一致性。在多个LVLM和基准上的实验表明,PADE改善了视觉基础并减少了幻觉,验证了利用内部注意力动态实现可靠多模态推理的有效性。

关键词

引用

@article{arxiv.2602.15556,
  title  = {Revealing and Enhancing Core Visual Regions: Harnessing Internal Attention Dynamics for Hallucination Mitigation in LVLMs},
  author = {Guangtao Lyu and Qi Liu and Chenghao Xu and Jiexi Yan and Muli Yang and Xueting Li and Fen Fang and Cheng Deng},
  journal= {arXiv preprint arXiv:2602.15556},
  year   = {2026}
}