将注意力整合到面向语言与视觉Transformer的解释框架中
机器学习
2025-08-13 v1 机器学习
摘要
注意力机制是Transformer架构的核心,它提供了一种可解释的模型内部信号,激发了人们对基于注意力的模型解释日益增长的兴趣。尽管注意力权重并不直接决定模型输出,但它们反映了token间的影响模式,可以为既有的可解释性技术提供信息并加以补充。本工作研究如何利用注意力权重中编码的信息,通过将其整合到针对模型行为根本不同方面的可解释人工智能(XAI)框架中,来提供有意义的模型解释。为此,我们开发了两种新颖的解释方法,适用于自然语言处理和计算机视觉任务。第一种方法通过注意力权重重新定义基于成对token交互的特征函数,将注意力权重整合到Shapley值分解中,从而调整这一广泛使用的博弈论解概念,为局部解释提供注意力驱动的归因。第二种方法将注意力权重整合到通过概念激活向量定义的token级方向导数中,以测量全局解释的概念敏感性。我们在标准基准上的实证评估以及与广泛使用的解释方法的比较研究表明,注意力权重可以有意义地融入所研究的XAI框架中,突显了它们在丰富Transformer可解释性方面的价值。
引用
@article{arxiv.2508.08966,
title = {Integrating attention into explanation frameworks for language and vision transformers},
author = {Marte Eggen and Jacob Lysnæs-Larsen and Inga Strümke},
journal= {arXiv preprint arXiv:2508.08966},
year = {2025}
}