面向变换器语言模型的分解基 XAI 方法深度分析
计算与语言
2025-02-25 v1
摘要
最近提出了各种 XAI 解释方法,用于变换器架构,使我们能够通过为输入 token 和中间表示分配重要性分数,从而洞察大型语言模型的决策过程。其中一类方法似乎在这一方向上表现非常突出,包括分解基方法,即通过网络重新分配模型预测逻辑的 XAI 方法,因为该值直接关联预测。在之前的文献中,我们注意到两大此类方法 — — 即 ALTI-Logit 和 LRP — 尚未进行对照分析,因此我们通过在主谓一致任务上对地面注释进行精细的定量评估,以及使用 BERT、GPT-2 和 LLaMA-3 进行各种定性检查来弥合这一差距。在此过程中,我们从算法和实现角度比较并扩展了 ALTI-Logit 和 LRP 方法,包括最近提出的 AttnLRP 变体。我们还将纳入基准测试的两个广泛使用的梯度基解释技术。最终,我们将心血来搜构建的评估语言模型中解释性基准数据集以及代码公开,以促进在明确定义的共同基础上评估 XAI 方法。
关键词
引用
@article{arxiv.2502.15886,
title = {A Close Look at Decomposition-based XAI-Methods for Transformer Language Models},
author = {Leila Arras and Bruno Puri and Patrick Kahardipraja and Sebastian Lapuschkin and Wojciech Samek},
journal= {arXiv preprint arXiv:2502.15886},
year = {2025}
}
备注
9 pages, 3 figures