通过模态内 token 交互解释多模态大语言模型
计算机视觉与模式识别
2025-10-02 v2 人工智能
摘要
多模态大语言模型(MLLMs)在各类视觉-语言任务中取得了显著成功,但其内部决策机制仍缺乏充分理解。现有可解释性研究主要聚焦于跨模态归因,即识别模型在输出生成期间关注的图像区域。然而,这些方法常忽略模态内依赖关系。在视觉模态中,对孤立图像块赋予重要性会因感受野受限而忽略空间上下文,导致碎片化且含噪的解释。在文本模态中,对前序 token 的依赖会引入虚假激活。未能有效缓解这些干扰会损害归因保真度。为解决这些局限,我们提出利用模态内交互来增强可解释性。针对视觉分支,我们引入多尺度解释聚合(MSEA),聚合多尺度输入上的归因以动态调整感受野,产生更整体且空间连贯的视觉解释。针对文本分支,我们提出激活排序相关性(ARC),通过 top- 预测排序的对齐来衡量上下文 token 与当前 token 的相关性。ARC 利用该相关性抑制来自无关上下文的虚假激活,同时保留语义连贯的激活。在最先进 MLLMs 与基准数据集上的大量实验表明,我们的方法始终优于现有可解释性方法,产生更忠实且细粒度的模型行为解释。
引用
@article{arxiv.2509.22415,
title = {Explaining multimodal LLMs via intra-modal token interactions},
author = {Jiawei Liang and Ruoyu Chen and Xianghao Jiao and Siyuan Liang and Shiming Liu and Qunli Zhang and Zheng Hu and Xiaochun Cao},
journal= {arXiv preprint arXiv:2509.22415},
year = {2025}
}