中文

真实场景下的大规模多语言神经机器翻译:发现与挑战

计算与语言 2019-07-12 v1 机器学习

摘要

我们介绍构建能够翻译任意语言对的通用神经机器翻译(NMT)系统的努力。我们通过构建一个单一的大规模多语言 NMT 模型朝着该目标设立里程碑,该模型处理 103 种语言,训练于超过 250 亿个样本。我们的系统展示了有效的迁移学习能力,显著提升了低资源语言的翻译质量,同时保持高资源语言翻译质量与有竞争力的双语基线相当。我们深入分析了通用 NMT 中实现质量与实用性所至关重要的模型构建各个方面。在我们原型化一个高质量通用翻译系统的同时,我们广泛的实证分析暴露了需要进一步解决的问题,并建议了未来研究的方向。

关键词

引用

@article{arxiv.1907.05019,
  title  = {Massively Multilingual Neural Machine Translation in the Wild: Findings and Challenges},
  author = {Naveen Arivazhagan and Ankur Bapna and Orhan Firat and Dmitry Lepikhin and Melvin Johnson and Maxim Krikun and Mia Xu Chen and Yuan Cao and George Foster and Colin Cherry and Wolfgang Macherey and Zhifeng Chen and Yonghui Wu},
  journal= {arXiv preprint arXiv:1907.05019},
  year   = {2019}
}