大型语言模型的优化超参数规律
机器学习
2026-05-21 v4 最优化与控制
摘要
大型语言模型推动了众多 AI 进展,但其训练资源密集且对超参数选择高度敏感。虽然规模定律为模型规模和数据需求提供了有价值的指导,但在选择动态超参数(如学习率 schedules)方面显得不足。为弥合这一差距,我们提出了优化超参数规律(Opt-Laws),该框架将最终训练损失预测为学习率 schedule、模型规模和数据规模的函数。基于 SDE 推导的收敛与逃逸分析,Opt-Laws 提供可解释的收敛与逃逸特征,能够在不同模型规模下预测最终训练损失,从而从小规模实验中预先选择合适的 schedule。实验上,Opt-Laws 在 held-out 配置中实现 94% 的 Top-2 命中率,正确识别了所有五个评估的 out-of-family 设置中最佳的 schedule 家族,并以 F1=0.92 检测到训练发散。
关键词
引用
@article{arxiv.2409.04777,
title = {Optimization Hyper-parameter Laws for Large Language Models},
author = {Xingyu Xie and Kuangyu Ding and Shuicheng Yan and Kim-Chuan Toh and Tianwen Wei},
journal= {arXiv preprint arXiv:2409.04777},
year = {2026}
}