中文

面向 LVLMs 对象幻觉缓解的因果导向双路径注意力干预

计算机视觉与模式识别 2025-11-13 v1 人工智能

摘要

对象幻觉仍是大型视觉语言模型 (LVLMs) 中的关键挑战,其中模型生成的内容与视觉输入不一致。现有的基于语言解码器的缓解方法常常独立调节视觉或文本注意力,忽略了它们作为两个关键因果因素的相互作用。为此,我们提出 Owl (Bi-mOdal attention reWeighting for Layer-wise hallucination mitigation),一个因果导向框架,通过结构因果图建模幻觉过程,将分解后的视觉和文本注意力视为中介变量。我们引入 VTACR (Visual-to-Textual Attention Contribution Ratio),一种新型指标,用于量化解码期间模态贡献的不平衡。我们的分析揭示,幻觉经常发生在低 VTACR 场景中,此时文本先验主导,视觉对齐被削弱。为缓解此问题,我们设计一种细粒度注意力干预机制,依据 VTACR 信号动态调整标记和层级注意力。最后,我们提出一种双路径对抗解码策略:一条路径强调视觉 grounding 预测,另一条路径放大幻觉预测——让视觉事实闪耀,幻觉崩溃。在 POPE 和 CHAIR 数据集上的实验结果表明,Owl 实现了显著的幻觉降低,在忠诚度方面达到新的 SOTA,同时保持了视觉语言理解能力。我们的代码已公开于 https://github.com/CikZ2023/OWL。

关键词

引用

@article{arxiv.2511.09018,
  title  = {Causally-Grounded Dual-Path Attention Intervention for Object Hallucination Mitigation in LVLMs},
  author = {Liu Yu and Zhonghao Chen and Ping Kuang and Zhikun Feng and Fan Zhou and Lan Wang and Gillian Dobbie},
  journal= {arXiv preprint arXiv:2511.09018},
  year   = {2025}
}

备注

9 pages, published to AAAI 2026