面向神经机器翻译的持续知识蒸馏
计算与语言
2023-06-13 v2
摘要
尽管由于数据版权、数据隐私和竞争差异化等原因,许多平行语料库并未公开,但训练好的翻译模型在开放平台上越来越多。在这项工作中,我们提出了一种称为持续知识蒸馏的方法,以利用现有的翻译模型来改进一个目标模型。其基本思想是顺序地将知识从每个训练好的模型迁移到被蒸馏的模型中。在中英和德英数据集上的大量实验表明,我们的方法在同构和异构训练模型设置下,均能比强基线取得显著且一致的改进,并且对恶意模型具有鲁棒性。
引用
@article{arxiv.2212.09097,
title = {Continual Knowledge Distillation for Neural Machine Translation},
author = {Yuanchi Zhang and Peng Li and Maosong Sun and Yang Liu},
journal= {arXiv preprint arXiv:2212.09097},
year = {2023}
}
备注
Accepted to ACL 2023. The source code is available at https://github.com/THUNLP-MT/CKD