连续空间中用于非自回归神经机器翻译的迭代精炼
计算与语言
2020-09-16 v1
摘要
我们提出一种高效的非自回归机器翻译推理过程,该过程在连续空间中纯迭代地精炼翻译。给定一个机器翻译的连续潜变量模型(Shu et al., 2020),我们训练一个推理网络来近似目标句子边缘对数概率的梯度,仅以潜变量作为输入。这使我们能够在推理时使用基于梯度的优化来寻找近似最大化其边缘概率的目标句子。由于每个精炼步骤仅涉及低维潜空间中的计算(实验中我们使用8),我们避免了现有非自回归推理过程常在词元空间中精炼所带来的计算开销。我们将我们的方法与最近提出的EM式推理过程(Shu et al., 2020)进行比较,后者在由离散和连续变量组成的混合空间中优化。我们在WMT'14 En-De、WMT'16 Ro-En和IWSLT'16 De-En上评估我们的方法,并观察到相对于EM式推理的两个优势:(1)计算高效,即每个精炼步骤快一倍;(2)更有效,在相同精炼步数下得到更高的边缘概率和BLEU分数。例如在WMT'14 En-De上,我们的方法能够比自回归模型快6.2倍解码,且翻译质量退化极小(0.9 BLEU)。
引用
@article{arxiv.2009.07177,
title = {Iterative Refinement in the Continuous Space for Non-Autoregressive Neural Machine Translation},
author = {Jason Lee and Raphael Shu and Kyunghyun Cho},
journal= {arXiv preprint arXiv:2009.07177},
year = {2020}
}
备注
Accepted to EMNLP 2020