基于逐层预测与深度监督的非自回归翻译
计算与语言
2021-10-15 v1
摘要
如何在保持高翻译质量的同时进行高效推理?现有的神经机器翻译模型(如 Transformer)性能卓越,但它们逐词解码,效率低下。近期的非自回归翻译模型加快了推理速度,但其翻译质量仍然较差。本文提出 DSLP,一种高效且高性能的机器翻译模型。其核心思想是使用深度监督(Deep Supervision)训练非自回归 Transformer,并引入额外的逐层预测(Layer-wise Predictions)。我们在四个翻译任务(WMT'14 英德和 WMT'16 英罗双向)上进行了大量实验。结果表明,与相应的基线模型相比,我们的方法持续提高了 BLEU 分数。具体而言,我们的最佳变体在三个翻译任务上优于自回归模型,同时推理效率提升了 14.8 倍。
引用
@article{arxiv.2110.07515,
title = {Non-Autoregressive Translation with Layer-Wise Prediction and Deep Supervision},
author = {Chenyang Huang and Hao Zhou and Osmar R. Zaïane and Lili Mou and Lei Li},
journal= {arXiv preprint arXiv:2110.07515},
year = {2021}
}