SAVAA:通过逐步自适应视觉注意力放大缓解LVLMs中的幻觉
计算机视觉与模式识别
2026-05-29 v2
摘要
近期一系列针对缓解大型视觉语言模型(LVLMs)中的幻觉的无训练方法,通过在单次前向传递中放大对视觉标记的注意力来实现。我们称这一范式为视觉注意力放大(VAA)。本文识别了现有VAA方法存在的双重失效模式,原因是其在生成步骤中使用固定的放大因子:该因子在某些步骤可能过弱,导致幻觉未被解决,而在其他步骤则过强,引入新的幻觉。针对此发现,我们提出了逐步自适应视觉注意力放大(SAVAA),一种新的VAA框架,用于估计每个生成标记的幻觉风险,并根据估计风险在下一生成步骤中自适应放大视觉注意力。具体而言,我们引入视觉 grounding 熵(VGE),这是一种轻量级的幻觉风险估计器,通过将预测熵与视觉 grounding 结合,为不确定且/或在图像中 grounding 较弱的标记分配更高风险。基于VGE,SAVAA使用估计的风险来校准下一生成步骤的VAA因子,对高风险步骤应用更强的放大,对低风险步骤应用更弱的放大。在LLaVA-NeXT-7B、Qwen3-VL-8B和InternVL3.5-8B上,SAVAA在CHAIR、SHR和AMBER等生成式幻觉基准上显著优于基线方法。代码已公开:https://github.com/JiachengZ01/SAVVA。
引用
@article{arxiv.2602.13600,
title = {SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification},
author = {Jiacheng Zhang and Feng Liu and Chao Du and Tianyu Pang},
journal= {arXiv preprint arXiv:2602.13600},
year = {2026}
}