中文

温度预热来自何处?面向范数约束优化器的自适应调度

机器学习 2026-05-19 v2 最优化与控制

摘要

我们研究针对范数约束优化器(如 Muon 和 Lion)的自适应学习率调度问题。我们提出了一种广义光滑性假设,即在次优解间隙下,局部曲率会减小。我们经验验证了在优化轨迹上,这一行为成立。在此假设下,我们在合适的学习率选择下,建立了收敛性保证,而热身随后衰减的调度策略则自然地从证明中得出,而非被人为设定。基于这一理论,我们开发了一个实用的学习率调度器,仅依赖标准超参数,能自动适应训练初期的热身持续时间。我们在使用 LLaMA 架构进行大规模语言模型预训练时,对该方法进行评估,结果表明,在所有考虑的实验设置下,我们的自适应热身选择 consistently 优于或至少等同于最佳手动调校的热身计划,而无需额外的超参数搜索。我们的源代码已公开于 https://github.com/brain-lab-research/llm-baselines/tree/warmup

关键词

引用

@article{arxiv.2602.05813,
  title  = {Where Does Warm-Up Come From? Adaptive Scheduling for Norm-Constrained Optimizers},
  author = {Artem Riabinin and Andrey Veprikov and Arman Bolatov and Martin Takáč and Aleksandr Beznosikov},
  journal= {arXiv preprint arXiv:2602.05813},
  year   = {2026}
}

备注

30 pages, 8 figures, 5 tables