中文

完备多语言神经机器翻译

计算与语言 2020-10-21 v1 机器学习

摘要

多语言神经机器翻译 (MNMT) 模型通常在联合的双语语料库集上训练,这些语料库极度以英语为中心(即英语作为源语言或目标语言)。虽然非英语两语言之间的直接数据偶尔显式可用,但其使用并不普遍。在本文中,我们首先退一步审视常用的双语语料库 (WMT),并重新揭示其中存在的隐式结构及其重要性:跨示例的多向对齐(同一句子存在于两种以上语言中)。我们着手研究利用多向对齐示例来丰富原始以英语为中心的平行语料库。我们重新引入来自所有源语言与目标语言间多向对齐语料库的直接平行数据。由此,以英语为中心的图扩展为完备图,每种语言对均相连。我们将具有此种连通模式的 MNMT 称为完备多语言神经机器翻译 (cMNMT),并通过一系列实验和分析展示其效用与效力。结合一种仅以目标语言为条件的新型训练数据采样策略,cMNMT 为所有语言对提供了具竞争力的翻译质量。我们进一步研究了多向对齐数据的规模效应、其迁移学习能力,以及它如何缓解 MNMT 中新语言的添加。最后,我们在大规模下对 cMNMT 进行压力测试,证明我们可以训练一个具有多达 111*112=12,432 个语言对的 cMNMT 模型,为所有语言对提供具竞争力的翻译质量。

关键词

引用

@article{arxiv.2010.10239,
  title  = {Complete Multilingual Neural Machine Translation},
  author = {Markus Freitag and Orhan Firat},
  journal= {arXiv preprint arXiv:2010.10239},
  year   = {2020}
}

备注

Accepted at WMT 2020