中文

Warmup-Distill:弥合知识蒸馏前教师与学生之间的分布失配

计算与语言 2025-02-18 v1

摘要

大型语言模型(LLM)的广泛部署受到高计算需求的阻碍,这使得知识蒸馏(KD)对于开发紧凑的小型模型至关重要。然而,传统的知识蒸馏方法存在教师模型与学生模型之间的分布失配问题,导致蒸馏性能不佳。例如,广泛使用的基于 KL 散度的方法由于两个模型之间概率分布的失配,面临模式平均和模式坍缩问题。以往的研究主要通过针对两个模型的分布进行不同的距离计算来优化此问题。遗憾的是,分布失配问题在蒸馏的早期阶段依然存在。因此,为了减少分布失配的影响,我们提出了一种简单而有效的方法,名为 Warmup-Distill,它在蒸馏之前提前将学生的蒸馏与教师的蒸馏对齐。具体而言,我们首先利用学生模型的内部知识检测其在实际场景中的分布,然后以教师作为检查器,修改低概率的知识。因此,Warmup-Distill 将学生的内部知识与教师的知识对齐,用教师的分布扩展学生的分布,并协助学生模型在后续的蒸馏中更好地学习。在七个基准上的实验表明,Warmup-Distill 能够提供一个更适合蒸馏的预热学生模型,在所有基准上比原始学生模型至少高出 +0.4 的平均分。值得注意的是,在 Warmup-Distill 的辅助下,数学任务上的蒸馏可以产生进一步的提升,准确率最高提升 +1.9%。

关键词

引用

@article{arxiv.2502.11766,
  title  = {Warmup-Distill: Bridge the Distribution Mismatch between Teacher and Student before Knowledge Distillation},
  author = {Zengkui Sun and Yijin Liu and Fandong Meng and Yufeng Chen and Jinan Xu and Jie Zhou},
  journal= {arXiv preprint arXiv:2502.11766},
  year   = {2025}
}

备注

11 Pages, 4 figures, Code at https://github.com/Acerkoo/WarmupDistill