中文

AdaIAT:适应性增加对生成文本注意力以缓解LVLM幻觉

计算机视觉与模式识别 2026-03-06 v1

摘要

幻觉一直是当前大型视觉语言模型(LVLM)开发和应用的重要障碍。为缓解幻觉,一种直观且有效的方法是增加推理期间对图像标记的注意力权重。虽然此方法有效降低了幻觉率,但常会引发重复描述。为此,我们首先分析注意力模式,发现真实物体标记倾向于对生成文本分配更高的注意力,而幻觉文本则相反。这启发我们利用包含指令相关视觉信息和语境知识的生成文本,以维持语言连贯性的同时缓解幻觉。我们因此提出注意力生成文本(IAT),并证明其显著降低了幻觉率,同时避免了重复描述。为防止直接放大干扰LVLM固有预测能力,我们进一步探索自适应IAT(AdaIAT),其采用分层阈值控制干预时机,并针对每个注意力头的特性进行细粒度放大幅度的调制。无论是分析还是实验结果都表明AdaIAT的有效性。几款LVLM的结果显示,AdaIAT有效缓解了幻觉(在LLaVA-1.5上将幻觉率C_S和C_I分别降低35.8%和37.1%),同时保持了语言性能和预测能力,实现了令人满意的权衡。

关键词

引用

@article{arxiv.2603.04908,
  title  = {AdaIAT: Adaptively Increasing Attention to Generated Text to Alleviate Hallucinations in LVLM},
  author = {Li'an Zhong and Ziqiang He and Jibin Zheng and Jin Li and Z. Jane Wang and Xiangui Kang},
  journal= {arXiv preprint arXiv:2603.04908},
  year   = {2026}
}