中文

强教师并非必需?关于大语言模型预训练中蒸馏的研究

机器学习 2026-05-25 v1 计算与语言

摘要

知识蒸馏通常假设存在由强到弱的关系,即更强的教师会产生更好的学生。本文探讨了关于大语言模型预训练中蒸馏这一假设。通过调整架构大小和训练标记预算,我们构建了强到弱、同等水平和弱到强的教师-学生关系,并研究了在每种情况下蒸馏的有效性。我们发现,教师并不必需强:通过对语言模型损失和知识蒸馏损失进行适当混合,甚至小且未充分训练的教师也能提高较大学生的性能。同时,更强的教师并不总是更好:通过增加参数或训练标记来提升教师,可能会使蒸馏收益饱和或甚至适得其反。我们进一步观察到,蒸馈比拟合更容易提升泛化能力(包括外部分布和下游任务性能)。综上,这些结果挑战了关于蒸馏预训练总是需要强教师的常见信念。

关键词

引用

@article{arxiv.2605.23857,
  title  = {Strong Teacher Not Needed? On Distillation in LLM Pretraining},
  author = {Taiming Lu and Zhuang Liu},
  journal= {arXiv preprint arXiv:2605.23857},
  year   = {2026}
}