中文

不要丢弃数据:更好的序列知识蒸馏

计算与语言 2024-07-16 v1

摘要

知识蒸馏的关键组件之一是教师模型和学生模型之间的耦合方式。当前主流的序列知识蒸馏方法通过监督学习学生模型,以教师模型解码后的输出为依据,此方法以当前最先进的 incorporating minimum Bayes risk (MBR) 解码技术为例。本文寻求将 MBR 更紧密地集成到蒸馏训练中,具体方法是使用多个高分数的 MBR 翻译结果,而非仅选取单个序列,从而捕获教师输出的丰富多样性。我们在英德及英日翻译任务上进行实验,结果显示相较于强大基线方法,本文方法在两种任务中均表现出一致的改进,且模型规模变化均有效。此外,我们还对数据效率和容量诅咒等方面进行了详细分析,以阐明 MBR-n 的作用并探索其进一步潜力。

关键词

引用

@article{arxiv.2407.10456,
  title  = {Don't Throw Away Data: Better Sequence Knowledge Distillation},
  author = {Jun Wang and Eleftheria Briakou and Hamid Dadkhahi and Rishabh Agarwal and Colin Cherry and Trevor Cohn},
  journal= {arXiv preprint arXiv:2407.10456},
  year   = {2024}
}