基于注意力机制的 Attribution 方法
机器学习
2025-04-21 v1 计算与语言
摘要
给定由语言模型生成的 token 序列,我们可能希望识别影响模型生成该序列的前导 token。进行此类 token attribution 代价较高;常见方法是消除前导 token 并直接测量其效果。为降低 token attribution 的成本,我们重新审视注意力权重作为衡量语言模型如何利用前导 token 的启发式方法。对注意力进行归因的简单方法(例如,对注意力头进行加权平均以估计 token 影响力)被发现不可靠。为实现可靠的归因,我们提出将不同注意力头的注意力权重视为特征。如此一来,我们便可学习如何有效地利用注意力权重进行归因(使用消除信号)。我们得到的方法,称为 Attribution with Attention(AT2),在可靠性上与涉及多次消除的方法相当,却显著更高效。为展示 AT2 的实用性,我们在问答任务中使用其剔除不重要上下文部分,以提升答案质量。我们在 https://github.com/MadryLab/AT2 提供 AT2 的代码。
引用
@article{arxiv.2504.13752,
title = {Learning to Attribute with Attention},
author = {Benjamin Cohen-Wang and Yung-Sung Chuang and Aleksander Madry},
journal= {arXiv preprint arXiv:2504.13752},
year = {2025}
}