中文

视觉注意力漂移,但锚点保持:通过跨层视觉锚点缓解多模态大语言模型中的幻觉

计算机视觉与模式识别 2026-03-27 v1

摘要

多模态大语言模型常常 suffer from object hallucination。虽然已有研究利用注意力增强和视觉回溯,但发现这些方法在最终模型阶段缺乏足够的注意力漂移可解释性。在本文中,我们研究了视觉特征在各层的演化过程,发现幻觉源于深层注意力在早期层的初始视觉噪声趋向回归。我们观察到,输出可靠性取决于获取中间层的视觉锚点,而非最终层。基于这些洞察,我们提出了 CLVA,即 Cross-Layer Visual Anchors,一种无需训练的方法,通过强化关键中间层特征同时抑制 regressive 噪声来实现。该方法有效地利用来自注意力动力学捕获的关键锚点,将深层注意力拉回正确的视觉区域。我们在多样化的架构和基准测试中评估了该方法,证明其在不显著增加计算时间和 GPU 内存的情况下,性能卓越。

关键词

引用

@article{arxiv.2603.25088,
  title  = {Visual Attention Drifts,but Anchors Hold:Mitigating Hallucination in Multimodal Large Language Models via Cross-Layer Visual Anchors},
  author = {Chengxu Yang and Jingling Yuan and Chuang Hu and Jiawei Jiang},
  journal= {arXiv preprint arXiv:2603.25088},
  year   = {2026}
}