中文

面向非自回归神经机器翻译的自蒸馏混合训练

计算与语言 2021-12-23 v1 人工智能

摘要

近年来,非自回归(NAT)模型并行预测输出,与自回归(AT)模型相比在生成速度上取得显著提升。尽管在原始数据上表现较差,大多数 NAT 模型作为学生模型在由 AT 教师模型生成的蒸馏数据上训练,即所谓的序列级知识蒸馏。一种提升 AT 模型性能的有效训练策略是自蒸馏混合(SDM)训练,其在原始数据上预训练模型,由预训练模型自身生成蒸馏数据,并最终在原始数据与蒸馏数据的组合上重新训练模型。在本工作中,我们旨在将 SDM 应用于 NAT 模型,但发现直接将 SDM 用于 NAT 模型在翻译质量上无提升。通过细致分析,我们观察到这种失效与 AT 教师模型与 NAT 学生模型之间的建模多样性和确认偏差相关。基于这些发现,我们提出一种增强策略 SDMRT,在经典 SDM 基础上增加两个阶段:一是对自蒸馏数据进行预重排,另一是在过滤后的教师蒸馏数据上微调。我们的结果在多个 NAT 模型上以 0.6 至 1.2 BLEU 优于基线。作为额外收益,对于迭代精炼 NAT 模型,我们的方法可在半数迭代次数内优于基线,意味着 2 倍加速。

关键词

引用

@article{arxiv.2112.11640,
  title  = {Self-Distillation Mixup Training for Non-autoregressive Neural Machine Translation},
  author = {Jiaxin Guo and Minghan Wang and Daimeng Wei and Hengchao Shang and Yuxia Wang and Zongyao Li and Zhengzhe Yu and Zhanglin Wu and Yimeng Chen and Chang Su and Min Zhang and Lizhi Lei and shimin tao and Hao Yang},
  journal= {arXiv preprint arXiv:2112.11640},
  year   = {2021}
}