注意力为何可能不可解释?
机器学习
2021-06-04 v4 机器学习
摘要
基于注意力的方法在模型解释中发挥着重要作用,其中计算得到的注意力权重期望用于高亮输入的关键部分(例如句子中的关键词)。然而,近期研究发现注意力作为重要性解释常常不如预期。例如,学习到的注意力权重有时会高亮意义较小的词元如“[SEP]”、“,”和“.”,并且经常与基于梯度的其他特征重要性指标不相关。近期关于注意力是否是一种解释的争论引起了相当的关注。本文中,我们论证造成该现象的一个根本原因是组合捷径,即除高亮部分外,注意力权重本身可能携带额外信息,可被注意力层之后的下游模型所利用。结果,注意力权重不再是纯粹的重要性指示器。我们从理论上分析了组合捷径,设计了一个直观实验证明其存在,并提出了两种缓解该问题的方法。我们在基于注意力的解释模型上进行了实证研究,结果表明所提方法能有效提升注意力机制的可解释性。
引用
@article{arxiv.2006.05656,
title = {Why Attentions May Not Be Interpretable?},
author = {Bing Bai and Jian Liang and Guanhua Zhang and Hao Li and Kun Bai and Fei Wang},
journal= {arXiv preprint arXiv:2006.05656},
year = {2021}
}
备注
Proceedings of the 27th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining