面向扩大语言模型的温启动有效性
机器学习
2026-05-14 v1
摘要
从给定检查点开始的模型增长旨在加速更大模型的训练,提供潜在的资源节省。尽管近期关注度日益增加,温启动在大规模训练中仍见于有限的实际采纳。我们将其归因于两个未充分探讨的因素:(1) 对保持较小模型在初始化时性能的过度关注,限制了新架构的算子设计;(2) 增长如何与超参数和规模行为交互的不足分析,加上文献中增长因子不一致。我们表明,保持基模型初始后增长性能并非强大的最终性能所必需,简单且架构无关的增长策略可以超过更复杂的温启动算子。关键的是,我们经验性地识别出增长因子 g 的上限,超出此上限后,从头开始的训练更高效。我们在多个消除实验 setup 中观察到这一点。值得注意的是,此限制也存在于先前已发布的结果中,但未被报告。在我们对稠密 MLP 和稠密语言模型的实验中,我们发现 2 倍的增长因子是最可靠的,可实现收敛加速,在 20 tokens/参数预算以下加速最为显著,随着预算增加而逐渐减弱。我们对这些观察拟合规模定律,以为实践者在何时以及如何增长提供预测性指导。总之,我们的分析为模型增长提供了实用指南和经验限制。
引用
@article{arxiv.2605.13405,
title = {When is Warmstarting Effective for Scaling Language Models?},
author = {Neeratyoy Mallik and Maciej Janowski and Johannes Hog and Herilalaina Rakotoarison and Josif Grabocka and Frank Hutter and Aaron Klein},
journal= {arXiv preprint arXiv:2605.13405},
year = {2026}
}