中文

通过注意力不平衡矫正缓解 LVLMs 中的对象幻觉

计算机视觉与模式识别 2026-03-26 v1 人工智能

摘要

大型视觉语言模型 (LVLMs) 中的对象幻觉严重损害其在实际应用中的可靠性,构成其在自动驾驶和医学图像分析等高风险场景部署的关键障碍。通过系统化的经验研究,我们识别出注意力分配的不平衡——无论是跨模态(即视觉与语言)还是单模态内部(在各 individual token 之间)——与对象幻觉发生之间存在强烈的因果关联。基于此洞察,我们提出了一种新的概念,即注意力不平衡,不仅量化了注意力差异的程度,还直观描绘了驱动对象幻觉的底层模式(例如对无关语言 token 的过度关注或对判别性视觉特征的不足关注)。为缓解对象幻觉,我们进一步提出了注意力不平衡矫正 (AIR),这是一种轻量级的解码时干预方法,通过重新分配注意力权重和调整注意力分布来矫正跨模态和 token 级别的不平衡。广泛的评估在四个主流 LVLMs 和三个基准测试 (CHAIR、POPE 和 MM-Vet) 上进行,包含七个基线,表明 AIR 在一致地降低对象幻觉率方面取得显著效果,较基线实现了最高可达 35.1% 的降低,同时在 diverse 视觉语言任务中提升了 LVLMs 的通用能力最高可达 15.9%。

关键词

引用

@article{arxiv.2603.24058,
  title  = {Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification},
  author = {Han Sun and Qin Li and Peixin Wang and Min Zhang},
  journal= {arXiv preprint arXiv:2603.24058},
  year   = {2026}
}

备注

CVPR 2026(Findings)