中文

蒸馏预训练:数据、零样本学习与测试时间扩展的现代视角

机器学习 2025-09-03 v1

摘要

过去一年中,蒸馏技术在大型语言模型(LLM)预训练中重新受到关注, exemplified by Llama-3.2和Gemma模型家族。虽然蒸馏历史上已显示出改进统计建模的效果,但其对现代LLM关键范式(如测试时间扩展和零样本学习)的影响仍未充分探讨。本文作出三项主要贡献:第一,我们表明采用蒸馏进行预训练可获得模型,其测试时间扩展能力显著优于传统方法。第二,我们观察到这种收益伴随一种权衡:蒸馏会损害零样本学习能力,尤其是通过归线头实现的零样本学习。第三,为阐明这些发现,我们在一个大二项模型的沙盒中研究蒸馏预训练,以分离观察的共同主导因素。最后,基于这些见解,我们为未来的预训练设计提供了各种指导方针。

关键词

引用

@article{arxiv.2509.01649,
  title  = {Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling},
  author = {Sachin Goyal and David Lopez-Paz and Kartik Ahuja},
  journal= {arXiv preprint arXiv:2509.01649},
  year   = {2025}
}