探究注意力在神经机器翻译中的解释力
计算与语言
2019-10-02 v1
摘要
注意力模型已成为神经机器翻译(NMT)的关键组件。它们常被隐式或显式地用于证明模型生成特定词元的决策合理性,但注意力在多大程度上是NMT中可靠的信息来源尚未得到严格确立。为评估注意力对NMT的解释力,我们考察了在修改训练后注意力模型关键方面的反事实注意力模型下产生相同预测的可能性。利用这些反事实注意力机制,我们评估了它们在翻译过程中仍保留功能词与内容词生成的程度。与最先进的注意力模型相比,我们的反事实注意力模型在德英数据集上生成了68%的功能词和21%的内容词。我们的实验表明,注意力模型本身不能可靠地解释NMT模型所做的决策。
引用
@article{arxiv.1910.00139,
title = {Interrogating the Explanatory Power of Attention in Neural Machine Translation},
author = {Pooya Moradi and Nishant Kambhatla and Anoop Sarkar},
journal= {arXiv preprint arXiv:1910.00139},
year = {2019}
}
备注
Accepted at the 3rd Workshop on Neural Generation and Translation (WNGT 2019) held at EMNLP-IJCNLP 2019 (Camera ready)