多语混合:示例插值改进多语言神经机器翻译
计算与语言
2022-03-16 v1 人工智能
摘要
多语言神经机器翻译模型被训练以最大化从多个语言对抽取示例混合后的似然。应用于这些模型的主导归纳偏置是跨语言共享词表与共享参数集;然而对应于不同语言对抽取的示例的输入与标签可能仍居于不同的子空间。本文中,我们引入多语言交叉编码器-解码器(mXEncDec)以在实例层面融合语言对。我们的方法将来自不同语言对的实例插值为联合的“交叉示例”,以鼓励跨语言共享输入与输出空间。为确保多语言设定下更好的示例融合,我们提出若干技术以改进重度数据不平衡下跨差异语言的示例插值。在大规模WMT多语言数据集上的实验表明,我们的方法显著提升了英译多、多译英及零样本翻译任务的质量(从+0.5 BLEU至最高+5.5 BLEU点)。在语码转换集上的结果展示了我们的方法提升模型对分布外多语言示例泛化的能力。我们还进行了定性与定量表示比较,以在表示层面分析我们方法的优势。
引用
@article{arxiv.2203.07627,
title = {Multilingual Mix: Example Interpolation Improves Multilingual Neural Machine Translation},
author = {Yong Cheng and Ankur Bapna and Orhan Firat and Yuan Cao and Pidong Wang and Wolfgang Macherey},
journal= {arXiv preprint arXiv:2203.07627},
year = {2022}
}
备注
ACL 2022