中文

利用预训练语言模型、嵌入蒸馏与 CTC 上采样策略提升非自回归翻译质量

计算与语言 2024-10-15 v3

摘要

非自回归方法旨在提升翻译模型的推理速度,尤其是那些以一遍前向方式生成输出的模型。然而,与自回归模型相比,这些方法通常存在翻译质量显著下降的问题。本文引入一系列创新技术,在保持推理速度大幅提升的同时增强非自回归翻译(NAT)模型的翻译质量。我们提出使用 CTC 损失微调预训练多语言语言模型(PMLMs)以有效训练 NAT 模型。此外,我们采用 MASK 插入方案进行上采样而非词元复制,并提出了一种嵌入蒸馏方法以进一步提升性能。在实验中,我们的模型在多个数据集上优于自回归基线模型(Transformer \textit{base}),包括 WMT'14 DE\leftrightarrowEN、WMT'16 RO\leftrightarrowEN 和 IWSLT'14 DE\leftrightarrowEN。值得注意的是,即使在训练过程中未使用蒸馏数据,我们的模型在 IWSLT'14 En\leftrightarrowDe 和 WMT'16 En\leftrightarrowRo 数据集上也取得了优于自回归基线模型的性能。值得强调的是,在 IWSLT'14 DE\rightarrowEN 数据集上,我们的模型取得了 39.59 的出色 BLEU 分数,刷新了最优性能纪录。此外,我们的模型相比自回归模型实现了 16.35 倍的显著加速。

关键词

引用

@article{arxiv.2306.06345,
  title  = {Improving Non-autoregressive Translation Quality with Pretrained Language Model, Embedding Distillation and Upsampling Strategy for CTC},
  author = {Shen-sian Syu and Juncheng Xie and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2306.06345},
  year   = {2024}
}

备注

12 pages, 6 figures