Facebook AI 的 WMT20 新闻翻译任务提交
计算与语言
2020-11-18 v1
摘要
本文描述了 Facebook AI 向 WMT20 共享新闻翻译任务提交的方案。我们聚焦于低资源设定,并参与了两个语言对——泰米尔语<->英语和因纽特语<->英语,其中域外双语文本和单语数据有限。我们采用两种主要策略应对低资源问题:利用所有可用数据以及使系统适应目标新闻领域。我们探索了利用所有语言的双语文本和单语数据的技术,例如自监督模型预训练、多语言模型、数据增强和重排序。为了更好地使翻译系统适应测试领域,我们探索了数据集标注和域内数据微调。我们观察到不同技术根据语言对的可用数据提供不同的改进。基于该发现,我们将这些技术整合到一个训练流程中。对于 En->Ta,我们探索了使用额外泰米尔语双语文本和单语数据的无约束设定,并表明可取得进一步改进。在测试集上,我们提交的最佳系统分别取得 Ta->En 和 En->Ta 的 21.5 和 13.7 BLEU,以及 Iu->En 和 En->Iu 的 27.9 和 13.0 BLEU。
引用
@article{arxiv.2011.08298,
title = {Facebook AI's WMT20 News Translation Task Submission},
author = {Peng-Jen Chen and Ann Lee and Changhan Wang and Naman Goyal and Angela Fan and Mary Williamson and Jiatao Gu},
journal= {arXiv preprint arXiv:2011.08298},
year = {2020}
}