充分利用多语预训练实现零样本神经机器翻译
计算与语言
2022-04-14 v2
摘要
本文证明多语预训练与多语微调对于促进零样本翻译中的跨语言迁移均至关重要,其中神经机器翻译(NMT)模型在监督训练期间未见的源语言上进行测试。遵循该思路,我们提出 SixT+,一个支持 100 种源语言但仅用 6 种源语言的平行数据集训练的多对英 NMT 强模型。SixT+ 用 XLM-R large 初始化解码器嵌入与完整编码器,随后以简单的两阶段训练策略训练编码器与解码器层。SixT+ 在多对英翻译上取得令人印象深刻的性能。它以平均 7.2 和 5.0 BLEU 的增益显著优于 CRISS 与 m2m-100 两个强多语 NMT 系统。此外,SixT+ 提供一组可进一步微调用于其他无监督任务的模型参数。我们展示添加 SixT+ 初始化在 Si<->En 与 Ne<->En 上以超过 1.2 平均 BLEU 优于最先进(state-of-the-art)的显式设计无监督 NMT 模型。当应用于零样本跨语言抽取式摘要时,其相较 mBART-ft 产生 12.3 ROUGE-L 的平均性能增益。我们开展详细分析以理解 SixT+ 的关键要素,包括辅助平行数据的多语性、位置解耦编码器及其编码器的跨语言可迁移性。
引用
@article{arxiv.2110.08547,
title = {Towards Making the Most of Multilingual Pretraining for Zero-Shot Neural Machine Translation},
author = {Guanhua Chen and Shuming Ma and Yun Chen and Dongdong Zhang and Jia Pan and Wenping Wang and Furu Wei},
journal= {arXiv preprint arXiv:2110.08547},
year = {2022}
}
备注
Accepted to ACL 2022. Code will be available at [https://github.com/ghchen18/acl22-sixtp]