中文

μP尺度化小模型:原理性热启动与超参数迁移

机器学习 2026-02-12 v1 人工智能 机器学习

摘要

现代大规模神经网络通常以多种规模进行训练和发布,以适应不同的推理预算。为提升效率,近期研究探索了模型尺度放大:从已训练的小模型初始化更大的模型,以Transfer知识并加速收敛。然而,该方法对需要在目标尺度放大的模型上调整的超参数较为敏感,直接调整代价高昂。仍不明确的是,使用尺度放大后,最常见的权妥方案——在小模型上调参并通过超参数尺度定律外推——是否仍然有效。我们通过针对模型宽度的原理性尺度放大方法,以及在该setting下高效调参的技术,来解决此问题。首先,受μP和任意维度架构的启发,我们引入一种适用于广泛架构和优化器的通用尺度放大方法,理论保证模型等价于其扩宽版本,允许对无限宽度极限进行严密分析。其次,我们将μPTransfer理论扩展为针对我们方法尺度放大的模型的超参数迁移技术,并经实证演示,在真实数据集和架构上该方法有效。

关键词

引用

@article{arxiv.2602.10545,
  title  = {$\mu$pscaling small models: Principled warm starts and hyperparameter transfer},
  author = {Yuxin Ma and Nan Chen and Mateo Díaz and Soufiane Hayou and Dmitriy Kunisky and Soledad Villar},
  journal= {arXiv preprint arXiv:2602.10545},
  year   = {2026}
}

备注

61 pages, 6 figures