中文

可预测规模:第一部分,步骤定律——大型语言模型预训练的最优超参数缩放定律

机器学习 2025-08-20 v7 人工智能

摘要

大型语言模型(LLM)在多样化任务上的卓越能力已为人所知,但其有效部署需要精确的超参数优化。虽然已有研究探索了超参数对模型性能的影响,但缺乏一种原则且可推广的框架,跨越不同模型架构和数据配方。本研究进行了前所未有的实证调查,在 100 万 NVIDIA H800 GPU 小时内训练超过 3700 个从零开始的 LLM,消耗近 100 万亿 token,建立了用于 LLM 预训练超参数优化的通用缩放定律,称为步骤定律(Step Law)。我们观察到,在固定模型规模(NN)和数据集规模(DD)的条件下,超参数景观呈凸性,具有广阔的最优区域,大幅降低了超参数搜索的复杂度。基于此洞察,我们正式定义并经验证地证明步骤定律:最优学习率遵循 NNDD 的幂律关系,而最优批量大小主要受 DD 影响,对 NN 影响不大。值得注意的是,我们估计的最优值与通过穷举搜索获得的全局最佳性能相差仅 0.094%。据我们所知,Step Law 是首个将不同模型形态和结构(如 Mixture-of-Experts 模型和稠密 transformer)统一起来,并在多样化数据配方下建立最优超参数缩放定律的模型。我们贡献了一个通用、即插即用的最优超参数工具,预计将推动大规模 LLM 训练的高效化。所有实验代码、数据和模型 checkpoint 均公开于 https://github.com/step-law/steplaw。

关键词

引用

@article{arxiv.2503.04715,
  title  = {Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining},
  author = {Houyi Li and Wenzhen Zheng and Qiufeng Wang and Hanshan Zhang and Zili Wang and Shijie Xuyang and Yuantao Fan and Zhenyu Ding and Haoying Wang and Ning Ding and Shuigeng Zhou and Xiangyu Zhang and Daxin Jiang},
  journal= {arXiv preprint arXiv:2503.04715},
  year   = {2025}
}

备注

22 pages