用于解释多模态LLM的Token激活图
计算机视觉与模式识别
2025-07-01 v1 人工智能
机器学习
摘要
多模态大语言模型(MLLM)正在广泛赋能各个领域。尽管取得了进展,但MLLM的可解释性仍未得到充分探索,这阻碍了更深入的理解、模型可信度以及有效可视化。不同于产生单一输出的常规视觉模型(如CNN、ViT、CLIP),MLLM会逐步生成一系列token,其中每个生成的token取决于前文上下文。因此,早期的上下文token可能引入冗余激活,干扰对后续token的解释。现有研究常常忽视了这一问题,但我们的观察表明,这些冗余关联显著损害解释可靠性。为此,我们提出一种估计因果推断方法,以消除上下文对解释的干扰,从而实现高质量的MLLM解释,并引入一种新型的秩高斯滤波器进一步减少激活噪声。我们将其称为Token激活图(TAM),以突出token之间相互作用的考量。TAM也表明其在解释MLLM的多个token方面具有优势,这不同于针对单一预测的类别激活图(CAM)。我们的方法在现有SOTA方法中显著优于其他方法,展示了可用于各种场景的高质量可视化结果,包括目标定位、故障案例分析、视频可视化、MLLM视觉比较以及模型理解(如颜色、形状、动作、位置、视觉推理、多轮对话等)。代码已在github.com/xmed-lab/TAM 上提供。
引用
@article{arxiv.2506.23270,
title = {Token Activation Map to Visually Explain Multimodal LLMs},
author = {Yi Li and Hualiang Wang and Xinpeng Ding and Haonan Wang and Xiaomeng Li},
journal= {arXiv preprint arXiv:2506.23270},
year = {2025}
}
备注
ICCV2025 Accepted