通过嫁接预训练语言模型实现多语言翻译
计算与语言
2021-09-14 v1
摘要
将一个语言的预训练BERT与另一个语言的GPT拼接起来能否翻译文本?仅使用单语数据的自监督训练已使预训练(掩码)语言模型在许多NLP任务中取得成功。然而,在机器翻译中直接将BERT作为编码器、GPT作为解码器具有挑战性,因为类GPT模型缺乏seq2seq解码器所需的跨注意力组件。本文中,我们提出Graformer来嫁接分别预训练的(掩码)语言模型以用于机器翻译。利用单语数据预训练和平行数据嫁接训练,我们最大限度地发挥了两类数据的效用。在60个方向上的实验表明,与同等规模的多语言Transformer相比,我们的方法在x2en方向上平均提升5.8 BLEU,在en2x方向上平均提升2.9 BLEU。
引用
@article{arxiv.2109.05256,
title = {Multilingual Translation via Grafting Pre-trained Language Models},
author = {Zewei Sun and Mingxuan Wang and Lei Li},
journal= {arXiv preprint arXiv:2109.05256},
year = {2021}
}
备注
Accepted in EMNLP 2021 (Findings)