中文

解决神经机器翻译中的稀有词问题

计算与语言 2015-06-02 v4 机器学习 神经与进化计算

摘要

神经机器翻译 (NMT) 是一种新的机器翻译方法,已展现出与传统方法相当的有希望的结果。传统 NMT 系统的一个显著弱点是无法正确翻译非常稀有的词:端到端 NMT 往往具有相对较小的词汇表,仅使用单个 unk 符号代表所有可能的表外 (OOV) 词。在本文中,我们提出并实现了一种解决此问题的有效技术。我们在经词对齐算法输出增强的数据上训练 NMT 系统,使 NMT 系统能够为译文中每个 OOV 词输出其在源句中对应词的位置。该信息随后在后处理步骤中被利用,以使用词典翻译每个 OOV 词。我们在 WMT14 英法翻译任务上的实验表明,该方法相比未使用此技术的等效 NMT 系统提供了高达 2.8 BLEU 点的显著提升。凭借 37.5 的 BLEU 分数,我们的 NMT 系统是首个超越 WMT14 竞赛任务最佳结果的系统。

关键词

引用

@article{arxiv.1410.8206,
  title  = {Addressing the Rare Word Problem in Neural Machine Translation},
  author = {Minh-Thang Luong and Ilya Sutskever and Quoc V. Le and Oriol Vinyals and Wojciech Zaremba},
  journal= {arXiv preprint arXiv:1410.8206},
  year   = {2015}
}

备注

ACL 2015 camera-ready version