神经机器翻译生成中的前瞻注意力机制
计算与语言
2017-08-31 v1
摘要
注意力模型已成为神经机器翻译(NMT)中的标准组件,并在预测每个目标词时有选择地关注源句子的部分内容以引导翻译过程。然而,我们发现目标词的生成不仅依赖于源句子,还严重依赖于先前生成的目标词,尤其是那些难以使用循环神经网络建模的远距离词。为解决此问题,本文提出一种用于神经机器翻译生成的新型前瞻注意力机制,旨在直接捕捉目标词之间的依赖关系。我们进一步设计了三种模式将此外瞻注意力整合到常规注意力模型中。在 NIST 汉英翻译和 WMT 英德翻译任务上的实验表明,我们所提出的前瞻注意力机制相比最先进的基线取得了显著提升。
引用
@article{arxiv.1708.09217,
title = {Look-ahead Attention for Generation in Neural Machine Translation},
author = {Long Zhou and Jiajun Zhang and Chengqing Zong},
journal= {arXiv preprint arXiv:1708.09217},
year = {2017}
}
备注
12 pages, 5 figures