权重衰减与批量大小在LLM预训练中的比例定律
机器学习
2025-11-25 v2 人工智能
计算与语言
摘要
高效LLM预训练需要调整良好的超参数(HP),包括学习率 和权重衰减 。我们研究了HP的比例定律:当我们缩放模型大小 N、数据集大小 D和批量大小 B时,如何缩放HP的公式。最近的工作表明,AdamW时间尺度 应在训练设置之间保持恒定,我们验证了最优 随B线性增长(在固定N和D的情况下)的含义。然而,随着N和D的扩大,我们发现最优 严格地遵循D/N(tokens-per-parameter比率)中的幂律定律。该定律因此提供了一种在大规模训练之前准确预测 的方法。我们还研究了最优批量大小 Bopt(在给定N、D的情况下实现最低损失的B)和临界批量大小 Bcrit(进一步数据并行变得无效的B)的比例定律。与先前工作不同,我们发现Bopt和Bcrit都遵循D中的幂律定律,独立于模型大小 N。最后,我们分析了这些发现如何信息实世界中在双训练时间和计算目标下选择Pareto最优的N和D。所有实验都在Cerebras CS-3系统上运行。
引用
@article{arxiv.2505.13738,
title = {Power Lines: Scaling Laws for Weight Decay and Batch Size in LLM Pre-training},
author = {Shane Bergsma and Nolan Dey and Gurpreet Gosal and Gavia Gray and Daria Soboleva and Joel Hestness},
journal= {arXiv preprint arXiv:2505.13738},
year = {2025}
}
备注
NeurIPS 2025