大型视觉语言模型中对象表征的因果追踪:机械可解释性与幻觉缓解
计算机视觉与模式识别
2025-11-20 v3
摘要
尽管大型视觉语言模型 (LVLMs) 在各方面取得了显著进展,但其机械可解释性仍鲜有探索。现有分析方法不够全面,也未覆盖视觉和文本标记、模型组件以及所有层的完整范围。这种局限性限制了可操作性洞见,以改善模型输出的忠实性并开发下游任务(如幻觉缓解)。为此,我们引入 Fine-grained Cross-modal Causal Tracing (FCCT) 框架,系统量化了对视觉对象感知的因果效应。FCCT 涵盖所有视觉和文本标记、包括多头自注意力 (MHSA)、前馈网络 (FFNs) 和隐藏状态在内的三个核心模型组件,以及所有解码器层。我们的分析首次表明,中间层最后一个标记的 MHSAs 在跨模态信息聚合中发挥关键作用,而 FFNs 显示出一种三阶段的层级进程,用于存储和传递视觉对象表征。基于这些发现,我们提出 Intermediate Representation Injection (IRI),一种训练自由的推理时技术,通过在特定组件和层的跨模态表征上进行精确干预来强化视觉对象信息流,从而增强感知并缓解幻觉。在五个广泛使用的基准测试和 LVLMs 上持续实现改进,显示 IRI 实现了最佳性能,同时保持推理速度和其他基础性能。
引用
@article{arxiv.2511.05923,
title = {Causal Tracing of Object Representations in Large Vision Language Models: Mechanistic Interpretability and Hallucination Mitigation},
author = {Qiming Li and Zekai Ye and Xiaocheng Feng and Weihong Zhong and Weitao Ma and Xiachong Feng},
journal= {arXiv preprint arXiv:2511.05923},
year = {2025}
}
备注
AAAI2026 Oral