非自回归神经机器翻译
计算与语言
2018-03-12 v2 机器学习
摘要
现有的神经机器翻译方法将每个输出词条件于先前生成的输出。我们引入一种避免该自回归特性并并行产生输出的模型,从而在推理时实现数量级更低的延迟。通过知识蒸馏、将输入词 fertility 作为潜变量以及策略梯度微调,我们以相对于用作教师的自回归 Transformer 网络仅损失少至 2.0 BLEU 点的代价实现了这一点。我们展示了训练策略三个方面各自带来的显著累积改进,并在 IWSLT 2016 英德和两组 WMT 语言对上验证了方法。通过在推理时并行采样 fertility,我们的非自回归模型在 WMT 2016 英罗任务上取得了接近最优的 29.8 BLEU 性能。
引用
@article{arxiv.1711.02281,
title = {Non-Autoregressive Neural Machine Translation},
author = {Jiatao Gu and James Bradbury and Caiming Xiong and Victor O. K. Li and Richard Socher},
journal= {arXiv preprint arXiv:1711.02281},
year = {2018}
}
备注
Accepted by ICLR 2018