中文

学习率预热加速收敛的理论分析

机器学习 2025-09-10 v1 最优化与控制

摘要

学习率预热是训练大规模深度神经网络中流行且实用的技术。尽管在实践中取得了巨大成功,但关于该策略在训练初期逐渐增加学习率的理论优势尚未得到充分理解。为弥合理论与实践之间的鸿沟,我们首先提出了一套新型广义光滑性假设,并在理论和实证层面验证了其适用性。在新光滑性假设下,我们研究了梯度下降(GD)在确定性和随机设置下的收敛性。结果表明,学习率预热能持续加速 GD 的收敛,在某些特定情况下,带预热的 GD 比非单调学习率方案收敛快至 Θ(T)\Theta(T) 倍,为从优化理论视角理解该策略的优势提供了洞见。

关键词

引用

@article{arxiv.2509.07972,
  title  = {Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence},
  author = {Yuxing Liu and Yuze Ge and Rui Pan and An Kang and Tong Zhang},
  journal= {arXiv preprint arXiv:2509.07972},
  year   = {2025}
}