注意力并非不是解释
计算与语言
2019-09-06 v2
摘要
注意力机制在 NLP(自然语言处理)系统中,尤其在循环神经网络(RNN)模型中扮演核心角色。近来,关于这些模块所提供的中间表示是否可用于解释模型预测背后的推理、进而获得对模型决策过程的洞察,兴趣日益增长。最近一篇论文声称“注意力不是解释”(Jain and Wallace, 2019)。我们挑战这项工作的诸多潜在假设,主张此类断言取决于一个人对解释的定义,且检验它需考虑模型的所有要素并使用严谨的实验设计。我们提出四种替代测试以确定注意力何时/是否可用作解释:简单的均匀权重基线;基于多次随机种子运行的方差校准;使用预训练模型冻结诊断框架;以及端到端对抗注意力训练协议。每一种都允许对 RNN 模型中的注意力机制进行有意义的解读。我们表明,即便能找到可靠的对抗分布,它们在简单诊断上表现不佳,这意味着先前的工作并未否定注意力机制在可解释性上的有用性。
引用
@article{arxiv.1908.04626,
title = {Attention is not not Explanation},
author = {Sarah Wiegreffe and Yuval Pinter},
journal= {arXiv preprint arXiv:1908.04626},
year = {2019}
}
备注
Accepted to EMNLP 2019; related blog post at https://medium.com/@yuvalpinter/attention-is-not-not-explanation-dbc25b534017