中文

利用单语数据与自监督提升多语言神经机器翻译

计算与语言 2020-05-12 v1 机器学习

摘要

在过去几年中,低资源神经机器翻译(NMT)出现了两个有前景的研究方向。第一个方向专注于利用高资源语言通过多语言NMT提升低资源语言的质量。第二个方向使用单语数据与自监督预训练翻译模型,然后在少量监督数据上微调。在本工作中,我们结合这两条研究路线,展示了单语数据与自监督在多语言NMT中的有效性。我们给出三个主要结果:(i)在多语言模型中使用单语数据显著提升了低资源语言的翻译质量。(ii)自监督改善了多语言模型中的零样本翻译质量。(iii)利用单语数据与自监督为向多语言模型添加新语言提供了一条可行路径,在没有任何平行数据或回译的情况下,在ro-en翻译上获得高达33 BLEU。

关键词

引用

@article{arxiv.2005.04816,
  title  = {Leveraging Monolingual Data with Self-Supervision for Multilingual Neural Machine Translation},
  author = {Aditya Siddhant and Ankur Bapna and Yuan Cao and Orhan Firat and Mia Chen and Sneha Kudugunta and Naveen Arivazhagan and Yonghui Wu},
  journal= {arXiv preprint arXiv:2005.04816},
  year   = {2020}
}