基于跨语言预训练的迁移用于零样本神经机器翻译
计算与语言
2019-12-04 v1
摘要
不同语言对之间的迁移学习已在低资源场景下的神经机器翻译(NMT)中展现出有效性。然而,现有的涉及一个共同目标语言的迁移方法在零样本翻译这一极端场景下远未成功,原因在于迁移方(父模型)与受让方(子模型)在源端存在语言空间不匹配问题。为应对这一挑战,我们提出了一种基于跨语言预训练的有效迁移学习方法。我们的核心思想是使所有源语言共享相同的特征空间,从而实现零样本翻译的平滑过渡。为此,我们引入了一种单语预训练方法和两种双语预训练方法,以获得面向不同语言的通用编码器。一旦构建好通用编码器,基于该编码器构建的父模型便使用大规模标注数据进行训练,然后直接应用于零样本翻译场景。在两个公开数据集上的实验表明,我们的方法显著优于基于枢纽语的强基线以及多种多语言 NMT 方法。
引用
@article{arxiv.1912.01214,
title = {Cross-lingual Pre-training Based Transfer for Zero-shot Neural Machine Translation},
author = {Baijun Ji and Zhirui Zhang and Xiangyu Duan and Min Zhang and Boxing Chen and Weihua Luo},
journal= {arXiv preprint arXiv:1912.01214},
year = {2019}
}
备注
Accepted as a conference paper at AAAI 2020 (oral presentation)