中文

面向多模态大语言模型的视觉引导注意力:消除幻觉的关键方法

计算机视觉与模式识别 2026-04-30 v3

摘要

视觉注意力是MLLMs解释视觉信息的主要机制;然而,其有限的局部化能力常导致幻觉现象。我们观察到尽管MLLMs能够准确提取视觉语义,但在后续推理过程中未能充分利用这一优势。为此,我们提出视觉引导注意力(Vision-Guided Attention, VGA),这是一种无需训练的方法,首先通过利用视觉标记的语义内容构建精确的视觉锚定,然后利用该锚定引导模型聚焦于相关视觉区域。在图像描述任务中,VGA进一步通过抑制已描述的区域来动态细化此引导。在VGA中,每个标记仅经过一次前向传播,引入的延迟开销可忽略不计。此外,VGA完全兼容诸如FlashAttention等高效注意力实现。广泛的实验在多种MLLMs和多个幻觉基准测试中表明,VGA在消除幻觉方面实现了SOTA性能。进一步分析确认,显式的视觉引导在提升MLLMs的视觉理解能力方面发挥着关键作用。

关键词

引用

@article{arxiv.2511.20032,
  title  = {Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention},
  author = {Jianfei Zhao and Feng Zhang and Xin Sun and Chong Feng and Zhixing Tan},
  journal= {arXiv preprint arXiv:2511.20032},
  year   = {2026}
}

备注

CVPR 2026