中文

关于优化器可靠标度定律的探索

机器学习 2026-02-25 v2

摘要

大型语言模型(LLM)预训练质量取决于多个因素,包括计算预算和优化算法的选择。经验标度定律广泛用于预测模型规模和训练数据增长时的损失值,但几乎所有现有研究都固定使用优化器(通常为 AdamW)。同时,新一代优化器(如 Muon、Shampoo、SOAP)承诺实现更快更稳定的收敛,但其与模型和数据标度的关系尚不明了。本文我们研究不同优化器下的标度定律。经验上,我们展示:1)针对每个优化器分别推导的 Chinchilla 风格标度定律条件不佳且参数高度相关;相反地,2)我们提出一种更稳健的标度定律,采用共享幂律指数和优化器特定的缩放因子,使不同优化器之间可直接比较;最后,3)我们对梯度基方法进行理论分析,针对凸二次目标任务,说明 Chinchilla 风格标度定律自然地作为损失分解为不可归约误差、逼近误差和优化误差的结果。

关键词

引用

@article{arxiv.2602.07712,
  title  = {Towards Robust Scaling Laws for Optimizers},
  author = {Alexandra Volkova and Mher Safaryan and Christoph H. Lampert and Dan Alistarh},
  journal= {arXiv preprint arXiv:2602.07712},
  year   = {2026}
}