中文

关于神经机器翻译预训练中的复制行为

计算与语言 2021-07-20 v1 机器学习

摘要

先前的研究表明,用预训练语言模型(LM)初始化神经机器翻译(NMT)模型可以加速模型训练并提升模型性能。在本工作中,我们指出了 NMT 预训练的一个关键副作用,其源于基于 LM 的预训练与 NMT 的训练目标之间的差异。由于 LM 目标学习重建少量源端词元并复制其中大部分,预训练初始化会影响 NMT 模型的复制行为。我们通过引入称为复制率(copying ratio)的指标对复制行为进行了定量分析,经验性地表明基于预训练的 NMT 模型比标准模型具有更大的复制率。针对该问题,我们提出了一种简单而有效的方法,称为复制惩罚(copying penalty),以在解码中控制复制行为。在域内和域外基准上的大量实验表明,复制惩罚方法通过控制基于预训练的 NMT 模型的复制行为,持续提升了翻译性能。源代码可在 https://github.com/SunbowLiu/CopyingPenalty 免费获取。

关键词

引用

@article{arxiv.2107.08212,
  title  = {On the Copying Behaviors of Pre-Training for Neural Machine Translation},
  author = {Xuebo Liu and Longyue Wang and Derek F. Wong and Liang Ding and Lidia S. Chao and Shuming Shi and Zhaopeng Tu},
  journal= {arXiv preprint arXiv:2107.08212},
  year   = {2021}
}

备注

Accepted to Findings of ACL 2021