凸优化理论与大模型训练学习率调度之间的惊人一致性
机器学习
2025-07-24 v2 最优化与控制
机器学习
摘要
我们展示了大模型训练的学习率调度在某种程度上与非光滑凸优化理论中的性能界限表现出惊人的相似性。我们给出常数调度配合线性冷却的界限;特别是,冷却的实际效益体现在由于缺乏对数项而导致的界限中。进一步,我们表明,这种优化理论与实践之间的惊人接近的匹配可以被利用用于学习率调优:我们通过 (i) 扩展持续训练的调度以获得最优学习率,以及 (ii) 在不同调度之间传递最优学习率,在训练 1.24 亿和 2.1 亿参数的 Llama 类模型时实现显著的改进。
引用
@article{arxiv.2501.18965,
title = {The Surprising Agreement Between Convex Optimization Theory and Learning-Rate Scheduling for Large Model Training},
author = {Fabian Schaipp and Alexander Hägele and Adrien Taylor and Umut Simsekli and Francis Bach},
journal= {arXiv preprint arXiv:2501.18965},
year = {2025}
}