面向非自回归神经机器翻译的选择性知识蒸馏
计算与语言
2023-08-07 v2
摘要
受益于序列级知识蒸馏,非自回归Transformer(NAT)在神经机器翻译任务中取得了巨大成功。然而,现有的知识蒸馏存在副作用,例如将教师模型的错误传播给NAT学生模型,这可能限制NAT模型的进一步提升,且在现有研究中鲜有讨论。本文引入选择性知识蒸馏,通过引入一个NAT评估器来选择高质量且易于学习、对NAT友好的目标。此外,我们提出一种简单而有效的渐进式蒸馏方法以提升NAT性能。在多个WMT语言方向及若干代表性NAT模型上的实验结果表明,我们的方法能够实现NAT模型训练数据质量与复杂度之间的灵活权衡,取得强劲性能。进一步分析显示,仅蒸馏5%的原始译文即可帮助NAT比在原始数据上训练的对应模型高出约2.4 BLEU。
引用
@article{arxiv.2303.17910,
title = {Selective Knowledge Distillation for Non-Autoregressive Neural Machine Translation},
author = {Min Liu and Yu Bao and Chengqi Zhao and Shujian Huang},
journal= {arXiv preprint arXiv:2303.17910},
year = {2023}
}
备注
Accepted to AAAI 2023