中文

基于现代优化理论推导超参数扩展定律

机器学习 2026-03-18 v1

摘要

超参数迁移已成为现代大规模训练配方的重要组成部分。现有方法(如 muP)主要关注模型规模之间的迁移,而规模跨批次大小和训练时程的迁移往往依赖于基于时间尺度保持、二次代理和连续时间近似所inform的经验性比例规则。我们通过将其视为基于线性最小化者(LMO)方法的最新收敛界的框架,研究现代一阶优化器的超参数比例律。将文献中的界作为代理并在不同调优 regime 下对其进行最小化,可得学习率、动量和批次大小作为迭代次数或 token 预算函数的闭形式幂律schedule。我们的分析在保持模型规模不变的条件下,统一且原则化地恢复了文献中大多数洞见与观察,明确指出了未来研究的明确方向。我们的结果特别关注动量与批次大小比例之间的相互作用,表明可能以多种比例策略实现最佳性能。

关键词

引用

@article{arxiv.2603.15958,
  title  = {Deriving Hyperparameter Scaling Laws via Modern Optimization Theory},
  author = {Egor Shulgin and Dimitri von Rütte and Tianyue H. Zhang and Niccolò Ajroldi and Bernhard Schölkopf and Antonio Orvieto},
  journal= {arXiv preprint arXiv:2603.15958},
  year   = {2026}
}

备注

v1: Preprint based on a short version published as a conference paper at SciForDL Workshop, 2nd edition