注意力并非解释
计算与语言
2019-05-10 v3 人工智能
摘要
注意力机制在神经自然语言处理模型中已被广泛采用。除提升预测性能外,这些机制常被宣扬为具有透明性:配备注意力的模型提供关于所关注输入单元的分布,而这常被(至少隐含地)呈现为传达了输入的相对重要性。然而,注意力权重与模型输出之间存在何种关系尚不清楚。在本工作中,我们跨多种自然语言处理任务进行了大量实验,旨在评估注意力权重在多大程度上提供有意义的预测“解释”。我们发现它们大体上并未提供。例如,学习到的注意力权重常与基于梯度的特征重要性度量不相关,并且可以识别出截然不同的注意力分布却仍产生等价预测。我们的研究结果表明,标准注意力模块并未提供有意义的解释,不应被当作如此对待。所有实验的代码可在 https://github.com/successar/AttentionExplanation 获取。
引用
@article{arxiv.1902.10186,
title = {Attention is not Explanation},
author = {Sarthak Jain and Byron C. Wallace},
journal= {arXiv preprint arXiv:1902.10186},
year = {2019}
}
备注
Accepted as NAACL 2019 Long Paper