ReAGent: 一种面向生成式语言模型的模型无关特征归因方法
计算与语言
2024-02-09 v2 人工智能
机器学习
摘要
特征归因方法(FAs),如梯度和注意力,被广泛用于推导所有输入特征对模型预测的重要性。现有的自然语言处理工作主要集中在开发和测试用于分类任务的编码器-仅语言模型(LM)的FAs。然而,由于模型架构和任务设置的内在差异,尚不清楚将这些FAs用于解码器-仅模型进行文本生成是否忠实。此外,先前工作表明,没有一种FA能在所有模型和任务上“一统天下”。这使得对于大型LM选择FA计算成本高昂,因为输入重要性推导通常需要多次前向和反向传播,包括梯度计算,即使有大量计算资源也可能难以承受。为解决这些问题,我们提出了一种模型无关的生成式LM特征归因方法,称为递归归因生成器(ReAGent)。我们的方法以递归方式更新令牌重要性分布。每次更新时,我们计算使用原始输入与使用修改版本(其中部分输入被RoBERTa预测替换)之间预测下一个令牌的词汇概率分布差异。我们的直觉是,替换上下文中的重要令牌应该比替换不重要令牌导致模型预测令牌置信度的更大变化。我们的方法可普遍应用于任何生成式LM,无需访问内部模型权重或额外训练和微调,而大多数其他FA需要这些。我们广泛比较了ReAGent与七种流行FA在六个不同大小的解码器-仅LM上的忠实性。结果表明,我们的方法始终提供更忠实的令牌重要性分布。
引用
@article{arxiv.2402.00794,
title = {ReAGent: A Model-agnostic Feature Attribution Method for Generative Language Models},
author = {Zhixue Zhao and Boxuan Shan},
journal= {arXiv preprint arXiv:2402.00794},
year = {2024}
}
备注
Accepted at AAAI24 workshop ReLM