注意力头不平衡在模态冲突幻觉中的因果证据
人工智能
2026-05-20 v1
摘要
模态冲突幻觉发生在多模态大语言模型 (MLLM) 优先于与之矛盾的视觉证据而非错误文本前提时。为理解为何视觉证据在生成过程中无法占据上风,我们从机制学角度考察哪些内部组件驱动或抵抗这一失败。我们通过跨五个开源 MLLM 的路径修补进行 head 级因果分析,识别出两种注意力头具有相反的因果作用:幻觉驱动型注意力头和幻觉抵抗型注意力头。我们发现一种一致性不对称:驱动效应更广泛分布且携带更大总体权重,而抵抗效应集中在少数高重要性注意力头中。消除实验进一步确认,这两种组在生成过程中发挥相反作用:分布式驱动影响与局部抵抗效应共同构成不平衡的路由结构,使生成偏向错误前提。鼓励这一发现,我们提出 MACI(Modality-conflict-Aware Causal Intervention),一种在检测到冲突时仅抑制被识别的幻觉驱动型注意力头的条件干预。跨五个 MLLM,MACI 在 MMMC benchmark 上实现了在比较推理时延迟中最大的幻觉减少,同时在 SCI-SemanticConflict 测试上实现零样迁移。
引用
@article{arxiv.2605.19250,
title = {Causal Evidence for Attention Head Imbalance in Modality Conflict Hallucination},
author = {Jinrui Jiang and Zhangtai Wu and Zhen Wu and Xinyu Dai},
journal= {arXiv preprint arXiv:2605.19250},
year = {2026}
}