何处开始:通过子网络选择与知识蒸馏实现高效预训练
计算与语言
2026-01-15 v2 人工智能
摘要
小型语言模型(Small Language Models, SLMs)作为大型语言模型(Large Language Models, LLMs)的高效替代方案,能在远少于资源的条件下展现出强大的性能。我们引入一个简单且高效的预训练框架,融合三个相互补充的核心思想。首先,我们识别出结构稀疏的子网络初始化方案,这些方案在相同的计算预算下, consistently 优于随机初始化的同等规模模型。其次,我们采用进化搜索自动发现高质量的子网络初始化,为预训练提供更优的起点。最后,我们应用来自大型教师模型的知识蒸馏,以加速训练并提升泛化能力。综合上述组件,SLMs的预训练显著提升了效率:我们最佳模型采用进化搜索发现,并使用LLM权重初始化,在10B和100B token配额下,分别比相应Pythia SLM所需的浮点运算次数分别减少5.16倍和1.26倍,同时保持相同的验证困惑度。我们公开全部代码,为大规模低成本小型语言模型开发提供了可实践、可复现的路径。
引用
@article{arxiv.2510.07227,
title = {Where to Begin: Efficient Pretraining via Subnetwork Selection and Distillation},
author = {Arjun Krishnakumar and Rhea Sanjay Sukthanker and Hannan Javed Mahadik and Gabriela Kadlecová and Vladyslav Moroshan and Timur Carstensen and Frank Hutter and Aaron Klein},
journal= {arXiv preprint arXiv:2510.07227},
year = {2026}
}