中文

基于逐层预测与深度监督的非自回归翻译

计算与语言 2021-10-15 v1

摘要

如何在保持高翻译质量的同时进行高效推理?现有的神经机器翻译模型(如 Transformer)性能卓越,但它们逐词解码,效率低下。近期的非自回归翻译模型加快了推理速度,但其翻译质量仍然较差。本文提出 DSLP,一种高效且高性能的机器翻译模型。其核心思想是使用深度监督(Deep Supervision)训练非自回归 Transformer,并引入额外的逐层预测(Layer-wise Predictions)。我们在四个翻译任务(WMT'14 英德和 WMT'16 英罗双向)上进行了大量实验。结果表明,与相应的基线模型相比,我们的方法持续提高了 BLEU 分数。具体而言,我们的最佳变体在三个翻译任务上优于自回归模型,同时推理效率提升了 14.8 倍。

关键词

引用

@article{arxiv.2110.07515,
  title  = {Non-Autoregressive Translation with Layer-Wise Prediction and Deep Supervision},
  author = {Chenyang Huang and Hao Zhou and Osmar R. Zaïane and Lili Mou and Lei Li},
  journal= {arXiv preprint arXiv:2110.07515},
  year   = {2021}
}