(不)一致的歌谣:自然语言处理中可解释人工智能评估的再评估
计算与语言
2022-05-11 v1 机器学习
摘要
NLP 社区中关于注意力权重能否用作解释——一种用于解释每个输入词元对特定预测重要性的机制——一直存在显著争论。迄今为止,“注意力即解释”的有效性是通过在使用基于 LSTM 的模型时,计算基于注意力的解释与现有特征归因解释之间的秩相关性来评估的。在我们的工作中,我们(i)在两类 NLP 任务上,比较了五种较新的特征归因方法与两种基于注意力的方法之间的秩相关性,并且(ii)将这一分析扩展到包含基于 transformer 的模型。我们发现,无论模型或任务如何,基于注意力的解释与任何近期特征归因方法都不存在强相关性。此外,我们发现对于基于 transformer 的模型,所测试的解释彼此之间均无强相关性,这使我们质疑一个基本假设:即我们是否应根据基于注意力的解释与现有特征归因解释方法的相关性程度来衡量其有效性。在五个数据集上使用两种不同模型进行实验后,我们认为社区应停止将秩相关性用作基于注意力的解释的评价指标。我们建议研究者和从业者应转而测试多种解释方法,并采用人在回路(human-in-the-loop)流程来确定解释是否与人类在特定用例上的直觉一致。
引用
@article{arxiv.2205.04559,
title = {A Song of (Dis)agreement: Evaluating the Evaluation of Explainable Artificial Intelligence in Natural Language Processing},
author = {Michael Neely and Stefan F. Schouten and Maurits Bleeker and Ana Lucic},
journal= {arXiv preprint arXiv:2205.04559},
year = {2022}
}