中文

看见公平,言必信:基于均等注意力的视觉语言对齐提升 grounding并减少幻觉

计算机视觉与模式识别 2026-04-14 v1

摘要

多模态大语言模型(MLLM)经常会生成图像中不存在的物体,原因通常是解码时注意力过度集中于视觉上突出或高频出现的内容。我们观察到,这种注意力分配的不公平是物体幻觉的根本原因:当稀有、小型或在上下文中次要的物体获得不足的注意力时,模型就无法在整个视觉场景中进行grounding。我们认为,无论其大小、频率或视觉显著性如何,图像中的每个物体在解码过程中都应获得平等的表征机会。为此,我们提出DOP-OBC(Dominant Object Penalty - Outlier Boost Coefficient),这是一种无训练且无需修改网络结构的解码策略,基于均等注意力原则构建。两种互补的物体感知信号协同工作:支配对象惩罚(Dominant Object Penalty, DOP)软性抑制对视觉支配区域注意力的集中,而离群增强系数(Outlier Boost Coefficient, OBC)则放大对稀有但被可靠检测的物体的注意力。这两种信号以行级逻辑调制方式注入因果注意力掩码中,无需参数更新,保持自回归解码特性。广泛实验表明,在图像和视频MLLM上,DOP-OBC在CHAIR和POPE基准测试中均显著降低了物体幻觉,同时在正确性、一致性、细节、上下文和时间维度上提升了GPT-4o评估的描述质量。DOP-OBC表明,注意力分配的公平性不仅是设计原则,更是通往更可靠多模态生成的实际有效之路。

关键词

引用

@article{arxiv.2604.09749,
  title  = {See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment},
  author = {Mohammad Anas Azeez and Ankan Deria and Zohaib Hasan Siddiqui and Adinath Madhavrao Dukre and Rafiq Ali and Sara Atito and Yutong Xie and Imran Razzak},
  journal= {arXiv preprint arXiv:2604.09749},
  year   = {2026}
}