中文

面向神经机器翻译的通用条件掩码语言预训练

计算与语言 2022-06-03 v3

摘要

预训练的序列到序列模型已显著改进了神经机器翻译(NMT)。与先前采用单向解码器的预训练模型不同,本文证明预训练一个带有双向解码器的序列到序列模型能为自回归和非自回归 NMT 带来显著的性能提升。具体而言,我们提出 CeMAT,一种在多语言大规模双语和单语语料上预训练的条件掩码语言模型。我们还引入了两种简单而有效的方法来增强 CeMAT:对齐代码切换与掩码、以及动态双掩码。我们进行了大量实验,结果表明我们的 CeMAT 能为从低资源到极高资源语言的所有场景带来显著性能提升,即自回归 NMT 上低资源最高 +14.4 BLEU、平均 +7.9 BLEU 的提升。对于非自回归 NMT,我们证明其也能带来一致的性能提升,即最高 +5.3 BLEU。据我们所知,这是首个为两种 NMT 任务微调预训练统一模型的工作。代码、数据和预训练模型可在 https://github.com/huawei-noah/Pretrained-Language-Model/tree/master/CeMAT 获取。

关键词

引用

@article{arxiv.2203.09210,
  title  = {Universal Conditional Masked Language Pre-training for Neural Machine Translation},
  author = {Pengfei Li and Liangyou Li and Meng Zhang and Minghao Wu and Qun Liu},
  journal= {arXiv preprint arXiv:2203.09210},
  year   = {2022}
}

备注

Accepted to ACL 2022 Main conference