中文

面向非自回归神经机器翻译的序列级训练

计算与语言 2021-09-02 v2 机器学习

摘要

近年来,神经机器翻译(NMT)在各种翻译任务中取得了显著成果。然而,由自回归机制决定的逐词生成方式导致 NMT 的翻译延迟较高,限制了其低延迟应用。非自回归神经机器翻译(NAT)去除了自回归机制,通过独立且同时生成目标词来实现显著的解码加速。尽管如此,NAT 仍以词级交叉熵损失作为训练目标,这并非最优,因为由于多模态问题,NAT 的输出无法被恰当评估。在本文中,我们提出使用序列级训练目标来训练 NAT 模型,这些目标将 NAT 输出作为整体进行评估,并与真实翻译质量良好相关。首先,我们提出基于为 NAT 定制的几种新颖强化算法来训练 NAT 模型以优化序列级评估指标(例如 BLEU),该方法通过降低梯度估计的方差优于常规方法。其次,我们为 NAT 模型引入了一种新颖的训练目标,旨在最小化模型输出与参考句子之间的 N-gram 词袋(BoN)差异。BoN 训练目标可微,且无需任何近似即可高效计算。最后,我们采用三阶段训练策略将这两种方法结合以训练 NAT 模型。我们在四个翻译任务(WMT14 En\leftrightarrowDe、WMT16 En\leftrightarrowRo)上验证了我们的方法,结果表明我们的方法大幅优于 NAT 基线,并在所有翻译任务上取得了卓越性能。源代码可在 https://github.com/ictnlp/Seq-NAT 获取。

关键词

引用

@article{arxiv.2106.08122,
  title  = {Sequence-Level Training for Non-Autoregressive Neural Machine Translation},
  author = {Chenze Shao and Yang Feng and Jinchao Zhang and Fandong Meng and Jie Zhou},
  journal= {arXiv preprint arXiv:2106.08122},
  year   = {2021}
}

备注

Computational Linguistics Journal