中文

利用多语言性提升低资源稀有语言的无监督机器翻译

计算与语言 2021-03-15 v2

摘要

无监督翻译在英-法、英-德等资源丰富语言对上已取得了令人印象深刻的性能。然而,早期研究表明,在涉及低资源、稀有语言的更现实设定中,无监督翻译表现很差,BLEU 不超过 3.0。在本工作中,我们表明多语言性对于使无监督系统在低资源设定下具有实用性至关重要。具体而言,我们提出一个单一模型,用于 5 种低资源语言(古吉拉特语、哈萨克语、尼泊尔语、僧伽罗语和土耳其语)与英语的互译方向,该模型通过三阶段训练方案利用来自其他高资源语言对的单语与辅助平行数据。我们超越了这些语言上所有当前最先进的无监督基线,取得最高达 14.4 BLEU 的提升。此外,我们超越了多个语言对的大量有监督 WMT 提交结果,并匹配了当前最先进的有监督尼泊尔语-英语模型性能。我们进行了一系列消融研究,以确立我们的模型在不同数据质量程度下的鲁棒性,并分析所提方法优于传统无监督模型的因素。

关键词

引用

@article{arxiv.2009.11201,
  title  = {Harnessing Multilinguality in Unsupervised Machine Translation for Rare Languages},
  author = {Xavier Garcia and Aditya Siddhant and Orhan Firat and Ankur P. Parikh},
  journal= {arXiv preprint arXiv:2009.11201},
  year   = {2021}
}

备注

Accepted to NAACL 2021