面向非自回归神经机器翻译的序列级训练
计算与语言
2021-09-02 v2 机器学习
摘要
近年来,神经机器翻译(NMT)在各种翻译任务中取得了显著成果。然而,由自回归机制决定的逐词生成方式导致 NMT 的翻译延迟较高,限制了其低延迟应用。非自回归神经机器翻译(NAT)去除了自回归机制,通过独立且同时生成目标词来实现显著的解码加速。尽管如此,NAT 仍以词级交叉熵损失作为训练目标,这并非最优,因为由于多模态问题,NAT 的输出无法被恰当评估。在本文中,我们提出使用序列级训练目标来训练 NAT 模型,这些目标将 NAT 输出作为整体进行评估,并与真实翻译质量良好相关。首先,我们提出基于为 NAT 定制的几种新颖强化算法来训练 NAT 模型以优化序列级评估指标(例如 BLEU),该方法通过降低梯度估计的方差优于常规方法。其次,我们为 NAT 模型引入了一种新颖的训练目标,旨在最小化模型输出与参考句子之间的 N-gram 词袋(BoN)差异。BoN 训练目标可微,且无需任何近似即可高效计算。最后,我们采用三阶段训练策略将这两种方法结合以训练 NAT 模型。我们在四个翻译任务(WMT14 EnDe、WMT16 EnRo)上验证了我们的方法,结果表明我们的方法大幅优于 NAT 基线,并在所有翻译任务上取得了卓越性能。源代码可在 https://github.com/ictnlp/Seq-NAT 获取。
引用
@article{arxiv.2106.08122,
title = {Sequence-Level Training for Non-Autoregressive Neural Machine Translation},
author = {Chenze Shao and Yang Feng and Jinchao Zhang and Fandong Meng and Jie Zhou},
journal= {arXiv preprint arXiv:2106.08122},
year = {2021}
}
备注
Computational Linguistics Journal