中文

随机特征模型学习率计划的最优理论与比例定律

无序系统与神经网络 2026-05-11 v2 机器学习 机器学习

摘要

设置深度学习模型的学习率(LR)是成功训练的关键环节。选择学习率往往通过经验性试验来完成。本文探讨了用于随机特征模型进行随机梯度下降(SGD)训练的最优学习率计划的可求解模型。我们考虑最优计划 ηT(t)\eta_T^\star(t),其中 tt 为当前迭代,TT 为训练时程。该计划既作为数值优化问题求解,也可使用最优控制理论解析求解。我们的分析揭示了两种 régime,我们称为易 phase 和 难 phase。在易 phase 中,最优计划为多项式衰减 ηT(t)Tξ(1t/T)δ\eta_T^\star(t) \simeq T^{-\xi} (1-t/T)^{\delta},其中 ξ\xiδ\delta 取决于特征和任务的属性。在难 phase 中,最优计划类似于 warmup-stable-decay,初始学习率恒定,随后在训练步骤的消失比例上进行退火。我们研究了学习率和 batch 大小的联合优化,发现 batch ramp 可在易 phase 中提高 wall-clock 时间。除了 SGD,我们推导了动量参数 β(t)\beta(t) 的最优计划,并表明其可提高难 phase 中的损失比例指数。我们将最优计划与各种基准进行比较,包括 (1) 最优常数学习率 ηT(t)Tξ\eta_T(t) \sim T^{-\xi} (2) 最优幂律 ηT(t)Tξtχ\eta_T(t) \sim T^{-\xi} t^{-\chi},发现该计划优于上述两种方案。我们的理论表明,学习率在训练时程中的迁移取决于模型和任务的结构。对于 CIFAR-5M 上的 ResNet 图像分类,学习曲线显示出难 phase 行为,其中最优基学习率在充分退火后保持恒定。GPT-2 风格的 transformer 在语言建模中表现出易 phase 行为,其中最优学习率在退火下仍会偏移。

关键词

引用

@article{arxiv.2602.04774,
  title  = {Theory of Optimal Learning Rate Schedules and Scaling Laws for a Random Feature Model},
  author = {Blake Bordelon and Francesco Mori},
  journal= {arXiv preprint arXiv:2602.04774},
  year   = {2026}
}