中文

面向资源丰富机器翻译的自监督与有监督联合训练

计算与语言 2021-06-09 v1

摘要

文本表示的自监督预训练已成功应用于低资源神经机器翻译(NMT)。然而,在资源丰富的 NMT 上通常难以获得显著增益。本文提出一种联合训练方法 F2F_2-XEnDec,将自监督与有监督学习结合以优化 NMT 模型。为利用互补的自监督信号服务于有监督学习,NMT 模型通过一种称为交叉编码器-解码器的新型过程在单语与平行句子杂交而成的样本上训练。在两个资源丰富的翻译基准 WMT'14 英德与 WMT'14 英法上的实验表明,我们的方法相较若干强基线方法取得大幅提升,并在引入回译后于英法翻译上以 46.19 BLEU 创下新的最先进水平。结果还显示,我们的方法能提升模型对输入扰动的鲁棒性,例如社交媒体上频繁出现的语码混合噪声。

关键词

引用

@article{arxiv.2106.04060,
  title  = {Self-supervised and Supervised Joint Training for Resource-rich Machine Translation},
  author = {Yong Cheng and Wei Wang and Lu Jiang and Wolfgang Macherey},
  journal= {arXiv preprint arXiv:2106.04060},
  year   = {2021}
}

备注

Accepted by ICML 2021