中文

克服神经机器翻译中低资源语言对的罕见词问题

计算与语言 2020-12-17 v2 机器学习 机器学习

摘要

在 (Koehn and Knowles, 2017) 提出的神经机器翻译(NMT)六大挑战中,罕见词问题被认为是最严重的一个,尤其在低资源语言翻译中。本文提出三种解决神经机器翻译系统中罕见词问题的方案。首先,我们通过将源端词嵌入直接连接到 NMT 注意力组件的输出,来增强源端上下文以预测目标词。其次,我们提出一种以监督方式学习英语未知词形态学的算法,以最小化罕见词问题的不利影响。最后,我们利用 WordNet 中的同义关系来克服 NMT 的未登录词(OOV)问题。我们在两个低资源语言对上评估了我们的方法:英语-越南语和日语-越南语。在实验中,我们在两个语言对上均取得了高达约 +1.0 BLEU 点的显著提升。

关键词

引用

@article{arxiv.1910.03467,
  title  = {Overcoming the Rare Word Problem for Low-Resource Language Pairs in Neural Machine Translation},
  author = {Thi-Vinh Ngo and Thanh-Le Ha and Phuong-Thai Nguyen and Le-Minh Nguyen},
  journal= {arXiv preprint arXiv:1910.03467},
  year   = {2020}
}