中文

学习率退火改善随机优化中的调参鲁棒性

机器学习 2026-02-17 v2 最优化与控制 机器学习

摘要

随机梯度方法中的学习率是一个关键的超参数,通过标准网格搜索进行调优的成本极高,尤其是对于训练具有数十亿参数的现代大规模模型而言。我们识别了学习率退火方案的理论优势——这些方案以多项式速率将学习率衰减至零,例如广泛使用的余弦调度——通过证明它们对因粗粒度网格搜索导致的初始参数失配具有更强的鲁棒性。我们在随机凸优化设置中进行了分析,证明采用退火调度的随机梯度下降的收敛率对乘法失配因子ρ(即网格分辨率)呈次线性依赖,达到 O(ρ^{1/(2p+1)}/√T) 的速率,其中 p 为多项式衰减的次数,T 为步数。这与在逆平方根调度和固定步长调度下获得的 O(ρ/√T) 速率形成对比,后者对 ρ 呈线性依赖。实验证实了与使用固定步长进行调优相比的鲁棒性提升,这对实际训练场景中超参数搜索的计算开销具有重要意义。

关键词

引用

@article{arxiv.2503.09411,
  title  = {Learning Rate Annealing Improves Tuning Robustness in Stochastic Optimization},
  author = {Amit Attia and Tomer Koren},
  journal= {arXiv preprint arXiv:2503.09411},
  year   = {2026}
}

备注

23 pages