不让任何语言掉队:扩展以人为中心的机器翻译
计算与语言
2022-08-26 v3 人工智能
摘要
在以在全球范围内消除语言障碍为目标的驱动下,机器翻译已巩固为当今人工智能研究的关键焦点。然而,此类努力已围绕一小部分语言凝聚,将绝大多数主要为低资源语言抛在身后。要打破 200 种语言障碍,同时确保安全、高质量的结果,并始终将伦理考量放在心上,需要什么?在 No Language Left Behind 中,我们通过首先与母语者进行探索性访谈来语境化对低资源语言翻译支持的需求,从而接受了这一挑战。然后,我们创建了旨在缩小低资源与高资源语言之间性能差距的数据集和模型。更具体地说,我们开发了一个基于稀疏门控专家混合(Sparsely Gated Mixture of Experts)的条件计算模型,该模型在通过为低资源语言量身定制的新颖且有效的数据挖掘技术所获得的数据上进行训练。我们提出了多种架构和训练改进,以在数千个任务上训练时抵消过拟合。关键的是,我们使用人工翻译基准 Flores-200 评估了超过 40,000 个不同翻译方向的性能,并将人工评估与涵盖 Flores-200 中所有语言的新型毒性基准相结合,以评估翻译安全性。我们的模型相对于先前最先进(state-of-the-art)水平实现了 44% BLEU 的相对提升,为实现通用翻译系统奠定了重要基础。最后,我们开源了本工作中描述的所有贡献,可在 https://github.com/facebookresearch/fairseq/tree/nllb 获取。
引用
@article{arxiv.2207.04672,
title = {No Language Left Behind: Scaling Human-Centered Machine Translation},
author = {NLLB Team and Marta R. Costa-jussà and James Cross and Onur Çelebi and Maha Elbayad and Kenneth Heafield and Kevin Heffernan and Elahe Kalbassi and Janice Lam and Daniel Licht and Jean Maillard and Anna Sun and Skyler Wang and Guillaume Wenzek and Al Youngblood and Bapi Akula and Loic Barrault and Gabriel Mejia Gonzalez and Prangthip Hansanti and John Hoffman and Semarley Jarrett and Kaushik Ram Sadagopan and Dirk Rowe and Shannon Spruit and Chau Tran and Pierre Andrews and Necip Fazil Ayan and Shruti Bhosale and Sergey Edunov and Angela Fan and Cynthia Gao and Vedanuj Goswami and Francisco Guzmán and Philipp Koehn and Alexandre Mourachko and Christophe Ropers and Safiyyah Saleem and Holger Schwenk and Jeff Wang},
journal= {arXiv preprint arXiv:2207.04672},
year = {2022}
}
备注
190 pages