反事实生成作为评估自回归语言模型归因方法忠实性的手段
计算与语言
2025-03-11 v4
摘要
尽管自回归语言模型已得到广泛采用,但可解释性评估研究主要集中于跨度填充和掩码语言模型。评估解释方法的忠实性——即解释方法在多大程度上准确地解释了模型的内部工作机制和决策过程——是一项具有挑战性的任务,因为很难将模型与其解释分离开来。大多数忠实性评估技术会破坏或移除特定归因(特征重要性)方法判定为重要的输入标记,并观察模型输出的相应变化。然而,对于自回归语言模型而言,这种方法由于其下一标记预测的训练目标,会产生分布外输入。在本研究中,我们提出了一种利用反事实生成来评估自回归语言模型归因方法忠实性的技术。我们的技术能够生成流畅且符合分布的反事实样本,从而使评估协议更加可靠。
引用
@article{arxiv.2408.11252,
title = {Counterfactuals As a Means for Evaluating Faithfulness of Attribution Methods in Autoregressive Language Models},
author = {Sepehr Kamahi and Yadollah Yaghoobzadeh},
journal= {arXiv preprint arXiv:2408.11252},
year = {2025}
}
备注
Accepted to BlackboxNLP @ EMNLP 2024