不要丢弃数据:更好的序列知识蒸馏
计算与语言
2024-07-16 v1
摘要
知识蒸馏的关键组件之一是教师模型和学生模型之间的耦合方式。当前主流的序列知识蒸馏方法通过监督学习学生模型,以教师模型解码后的输出为依据,此方法以当前最先进的 incorporating minimum Bayes risk (MBR) 解码技术为例。本文寻求将 MBR 更紧密地集成到蒸馏训练中,具体方法是使用多个高分数的 MBR 翻译结果,而非仅选取单个序列,从而捕获教师输出的丰富多样性。我们在英德及英日翻译任务上进行实验,结果显示相较于强大基线方法,本文方法在两种任务中均表现出一致的改进,且模型规模变化均有效。此外,我们还对数据效率和容量诅咒等方面进行了详细分析,以阐明 MBR-n 的作用并探索其进一步潜力。
引用
@article{arxiv.2407.10456,
title = {Don't Throw Away Data: Better Sequence Knowledge Distillation},
author = {Jun Wang and Eleftheria Briakou and Hamid Dadkhahi and Rishabh Agarwal and Colin Cherry and Trevor Cohn},
journal= {arXiv preprint arXiv:2407.10456},
year = {2024}
}