中文

PARADISE: 利用平行数据实现多语言序列到序列预训练

计算与语言 2021-08-05 v1 机器学习

摘要

尽管多语言序列到序列预训练取得了成功,现有大多数方法依赖于单语语料库,并未利用平行数据中包含的强跨语言信号。本文提出PARADISE (PARAllel & Denoising Integration in SEquence-to-sequence models,序列到序列模型中的平行与去噪集成),通过将用于训练这些模型的常规去噪目标扩展为(i)根据多语言词典替换带噪序列中的词,以及(ii)根据平行语料预测参考译文而非恢复原始序列。我们在机器翻译与跨语言自然语言推理上的实验表明,将平行数据融入预训练分别带来平均2.0个BLEU点和6.7个准确率点的提升,并以远低于若干流行模型的计算成本取得了具竞争力的结果。

关键词

引用

@article{arxiv.2108.01887,
  title  = {PARADISE: Exploiting Parallel Data for Multilingual Sequence-to-Sequence Pretraining},
  author = {Machel Reid and Mikel Artetxe},
  journal= {arXiv preprint arXiv:2108.01887},
  year   = {2021}
}

备注

Preprint