中文

关于在神经机器翻译中使用单语语料库

计算与语言 2015-06-15 v2

摘要

最近基于端到端神经网络架构的机器翻译工作已在英-法和英-德翻译上显示出有前景的结果。可以说,这一成功背后的主要因素之一是高质量平行语料库的可用性。在这项工作中,我们研究如何利用丰富的单语语料库用于神经机器翻译。与基于短语和分层的基线相比,我们在低资源语言对土耳其语-英语上获得了高达 1.961.96 BLEU 的提升,在聚焦领域任务中文-英语聊天消息上获得了 1.591.59 BLEU。虽然我们的方法最初针对此类具有较少平行数据的任务,但我们展示它也扩展到高资源语言如捷克语-英语和德语-英语,我们在神经机器翻译基线上分别获得了 0.390.390.470.47 BLEU 分数的提升。

关键词

引用

@article{arxiv.1503.03535,
  title  = {On Using Monolingual Corpora in Neural Machine Translation},
  author = {Caglar Gulcehre and Orhan Firat and Kelvin Xu and Kyunghyun Cho and Loic Barrault and Huei-Chi Lin and Fethi Bougares and Holger Schwenk and Yoshua Bengio},
  journal= {arXiv preprint arXiv:1503.03535},
  year   = {2015}
}

备注

9 pages, 2 figures