Seesaw:通过平衡学习率和批量大小调度加速训练
机器学习
2025-10-17 v1 人工智能
最优化与控制
机器学习
摘要
在训练过程中增加批量大小——所谓的“批量递增”——是加速大型语言模型预训练的有前景的策略。虽然对于随机梯度下降(SGD),双倍批量大小等价于减半学习率,但对于像 Adam 这样的自适应优化器,最佳策略就不那么清晰了。因此,任何使用的批量递增调度(if any),通常都是经验性地调谐的。本工作发展出一种以原则为导驱的批量大小调度框架,介绍了 Seesaw:当标准调度器会减半学习率时,Seesaw 而是将其乘以 ,并翻倍批量大小,以保持损失动态同时减少串行步骤。理论上,我们提供了(据我们所知)首个关于 SGD 在带噪声的线性回归问题上,学习率衰减与批量大小递增等价性的有限样本证明,并将这种等价性推广到归一化 SGD,这是一种可处理的 Adam 代理,在实际操作中观察到的方差主导 regimes 下有效。经验上,在使用恒定(关键)批量大小训练 150M/300M/600M 参数模型的情况下,Seesaw 在相等 FLOPs 下匹配余弦衰减,同时将 wall-clock 时间缩短约36%,接近我们分析所暗示的理论极限。
引用
@article{arxiv.2510.14717,
title = {Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling},
author = {Alexandru Meterez and Depen Morwani and Jingfeng Wu and Costin-Andrei Oncescu and Cengiz Pehlevan and Sham Kakade},
journal= {arXiv preprint arXiv:2510.14717},
year = {2025}
}