中文

用于神经机器翻译的GRU门控注意力模型

计算与语言 2019-11-14 v2

摘要

神经机器翻译(NMT)严重依赖注意力网络为每个目标词预测生成上下文向量。在实践中,我们发现不同目标词的上下文向量彼此十分相似,因此在判别性预测目标词时不够充分。其原因可能是,普通注意力网络产生的上下文向量仅仅是源表示的加权和,而这些源表示对于解码器状态是不变的。本文提出一种用于NMT的新型GRU门控注意力模型(GAtt),通过使源表示对解码器生成的局部翻译敏感,增强了上下文向量的判别程度。GAtt使用门控循环单元(GRU)来结合两类信息:将双向编码器最初生成的源标注向量视为历史状态,而将相应的先前解码器状态作为GRU的输入。GRU结合的信息形成新的源标注向量。通过这种方式,我们可以获得对翻译敏感的源表示,进而将其输入注意力网络以生成具有判别性的上下文向量。我们进一步提出一种变体,将源标注向量视为当前输入,而先前解码器状态视为历史。在NIST中英翻译任务上的实验表明,两种基于GAtt的模型均相比普通基于注意力的NMT取得显著提升。对注意力权重和上下文向量的进一步分析证明了GAtt在提升表示判别力以及处理过翻译这一挑战性问题上的有效性。

关键词

引用

@article{arxiv.1704.08430,
  title  = {A GRU-Gated Attention Model for Neural Machine Translation},
  author = {Biao Zhang and Deyi Xiong and Jinsong Su},
  journal= {arXiv preprint arXiv:1704.08430},
  year   = {2019}
}