随机特征模型学习率计划的最优理论与比例定律
无序系统与神经网络
2026-05-11 v2 机器学习
机器学习
摘要
设置深度学习模型的学习率(LR)是成功训练的关键环节。选择学习率往往通过经验性试验来完成。本文探讨了用于随机特征模型进行随机梯度下降(SGD)训练的最优学习率计划的可求解模型。我们考虑最优计划 ,其中 为当前迭代, 为训练时程。该计划既作为数值优化问题求解,也可使用最优控制理论解析求解。我们的分析揭示了两种 régime,我们称为易 phase 和 难 phase。在易 phase 中,最优计划为多项式衰减 ,其中 和 取决于特征和任务的属性。在难 phase 中,最优计划类似于 warmup-stable-decay,初始学习率恒定,随后在训练步骤的消失比例上进行退火。我们研究了学习率和 batch 大小的联合优化,发现 batch ramp 可在易 phase 中提高 wall-clock 时间。除了 SGD,我们推导了动量参数 的最优计划,并表明其可提高难 phase 中的损失比例指数。我们将最优计划与各种基准进行比较,包括 (1) 最优常数学习率 (2) 最优幂律 ,发现该计划优于上述两种方案。我们的理论表明,学习率在训练时程中的迁移取决于模型和任务的结构。对于 CIFAR-5M 上的 ResNet 图像分类,学习曲线显示出难 phase 行为,其中最优基学习率在充分退火后保持恒定。GPT-2 风格的 transformer 在语言建模中表现出易 phase 行为,其中最优学习率在退火下仍会偏移。
引用
@article{arxiv.2602.04774,
title = {Theory of Optimal Learning Rate Schedules and Scaling Laws for a Random Feature Model},
author = {Blake Bordelon and Francesco Mori},
journal= {arXiv preprint arXiv:2602.04774},
year = {2026}
}