注意力机制不学习加性模型:重新思考Transformer的特征重要性
机器学习
2025-01-10 v2 人工智能
计算与语言
摘要
我们解决了将特征归因方法应用于Transformer架构的关键挑战,该架构主导了当前自然语言处理及其他领域的应用。传统的可解释AI(XAI)归因方法明确或隐含地依赖线性或加性替代模型来量化输入特征对模型输出的影响。在这项工作中,我们正式证明了一个令人担忧的不兼容性:Transformer在结构上无法表示用于特征归因的线性或加性替代模型,这破坏了这些传统解释方法的基础。为了解决这一差异,我们引入了Softmax-Linked Additive Log Odds Model (SLALOM),一种专门为与Transformer框架对齐而设计的新型替代模型。SLALOM展示了在合成和真实世界数据集上提供一系列有洞察力的解释的能力。我们通过展示SLALOM可以产生比竞争替代模型更高保真度的解释,或者以更低的计算成本提供同等质量的解释,来强调SLALOM独特的效率-质量曲线。我们将SLALOM的代码作为开源项目发布在https://github.com/tleemann/slalom_explanations。
引用
@article{arxiv.2405.13536,
title = {Attention Mechanisms Don't Learn Additive Models: Rethinking Feature Importance for Transformers},
author = {Tobias Leemann and Alina Fastowski and Felix Pfeiffer and Gjergji Kasneci},
journal= {arXiv preprint arXiv:2405.13536},
year = {2025}
}
备注
TMLR Camera-Ready version