PARADISE: 利用平行数据实现多语言序列到序列预训练
计算与语言
2021-08-05 v1 机器学习
摘要
尽管多语言序列到序列预训练取得了成功,现有大多数方法依赖于单语语料库,并未利用平行数据中包含的强跨语言信号。本文提出PARADISE (PARAllel & Denoising Integration in SEquence-to-sequence models,序列到序列模型中的平行与去噪集成),通过将用于训练这些模型的常规去噪目标扩展为(i)根据多语言词典替换带噪序列中的词,以及(ii)根据平行语料预测参考译文而非恢复原始序列。我们在机器翻译与跨语言自然语言推理上的实验表明,将平行数据融入预训练分别带来平均2.0个BLEU点和6.7个准确率点的提升,并以远低于若干流行模型的计算成本取得了具竞争力的结果。
引用
@article{arxiv.2108.01887,
title = {PARADISE: Exploiting Parallel Data for Multilingual Sequence-to-Sequence Pretraining},
author = {Machel Reid and Mikel Artetxe},
journal= {arXiv preprint arXiv:2108.01887},
year = {2021}
}
备注
Preprint