中文

基于子词单元的罕见词神经机器翻译

计算与语言 2016-06-13 v5

摘要

神经机器翻译 (NMT) 模型通常在固定词表上进行操作,但翻译是一个开放词表问题。先前的工作通过回退到词典来解决未登录词的翻译。在本文中,我们引入了一种更简单且更有效的方法,通过将罕见词和未知词编码为子词单元序列,使 NMT 模型具备开放词表翻译的能力。这基于一种直觉,即各种词类可以通过比词更小的单元进行翻译,例如名称(通过字符复制或音译)、复合词(通过组合翻译)以及同源词和外来词(通过语音和形态变换)。我们讨论了不同分词技术的适用性,包括简单的字符 n-gram 模型和基于字节对编码压缩算法的分词,并实证表明,在 WMT 15 英德和英俄翻译任务中,子词模型相比回退词典基线分别提高了 1.1 和 1.3 BLEU。

关键词

引用

@article{arxiv.1508.07909,
  title  = {Neural Machine Translation of Rare Words with Subword Units},
  author = {Rico Sennrich and Barry Haddow and Alexandra Birch},
  journal= {arXiv preprint arXiv:1508.07909},
  year   = {2016}
}

备注

accepted at ACL 2016; new in this version: figure 3