多模态大语言模型关注何处与依赖何物:解释自回归令牌生成
计算机视觉与模式识别
2026-03-19 v5
摘要
多模态大语言模型在将视觉输入与自然语言输出对齐方面展现了卓越的能力。然而,生成的令牌在多大程度上依赖于视觉模态仍知之甚少,这限制了其可解释性和可靠性。在这项工作中,我们提出了EAGLE,一个用于解释多模态大语言模型中自回归令牌生成的轻量级黑盒框架。EAGLE将任何选定的令牌归因于紧凑的感知区域,同时量化语言先验和感知证据的相对影响。该框架引入了一个目标函数,该函数统一了充分性(洞察分数)和不可或缺性(必要性分数),并通过在稀疏化图像区域上进行贪婪搜索来优化,以实现忠实且高效的归因。除了空间归因之外,EAGLE还执行模态感知分析,以解耦令牌所依赖的内容,从而提供对模型决策的细粒度可解释性。跨开源多模态大语言模型的大量实验表明,EAGLE在忠实性、定位和幻觉诊断方面始终优于现有方法,同时显著减少了GPU内存需求。这些结果突显了其在推进多模态大语言模型可解释性方面的有效性和实用性。
引用
@article{arxiv.2509.22496,
title = {Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation},
author = {Ruoyu Chen and Xiaoqing Guo and Kangwei Liu and Siyuan Liang and Shiming Liu and Qunli Zhang and Laiyuan Wang and Hua Zhang and Xiaochun Cao},
journal= {arXiv preprint arXiv:2509.22496},
year = {2026}
}
备注
Accepted to CVPR 2026