迈向透明且可解释的注意力模型
计算与语言
2020-04-30 v1
摘要
近期关于注意力分布可解释性的研究引出了模型预测忠实性与合理性解释的概念。若更高的注意力权重意味着对模型预测有更大影响,则注意力分布可被视为忠实解释;若其能为模型预测提供人类可理解的合理性说明,则可被视为合理解释。本文中,我们首先解释为何当前基于 LSTM 的编码器中的注意力机制既无法提供模型预测的忠实解释,也无法提供合理解释。我们观察到,在基于 LSTM 的编码器中,不同时刻的隐藏表示彼此非常相似(高锥形度),在此情形下注意力权重意义不大,因为即便对注意力权重做随机置换也不影响模型预测。基于在多种任务与数据集上的实验,我们观察到注意力分布常将模型预测归因于标点等不重要的词,且无法为预测提供合理解释。为使注意力机制更具忠实性与合理性,我们提出了一种改进的 LSTM 单元,其带有多样性驱动的训练目标,以确保不同时刻学到的隐藏表示具有多样性。我们表明,所得注意力分布提供了更高透明度,因为它们(i)给出了隐藏状态更精确的重要性排序,(ii)能更好地指示对模型预测重要的词,(iii)与基于梯度的归因方法相关性更好。人工评估表明,我们的模型学到的注意力分布为模型预测提供了合理解释。我们的代码已公开于 https://github.com/akashkm99/Interpretable-Attention。
引用
@article{arxiv.2004.14243,
title = {Towards Transparent and Explainable Attention Models},
author = {Akash Kumar Mohankumar and Preksha Nema and Sharan Narasimhan and Mitesh M. Khapra and Balaji Vasan Srinivasan and Balaraman Ravindran},
journal= {arXiv preprint arXiv:2004.14243},
year = {2020}
}
备注
Accepted at ACL 2020