你的批量大小是问题吗?关于语言模型中Adam与SGD差距的重新考察
机器学习
2025-06-17 v1 最优化与控制
摘要
Adam被证实在语言模型中显著优于随机梯度下降(SGD),人们已提出多种解释来解释这一现象。在本工作中,我们通过一系列全面调谐的基准训练运行重新审视这一“优化器差距”,专注于Transformer语言模型。我们详尽研究了动量、梯度裁剪和批量大小如何影响SGD与Adam之间的差距。我们的实证发现表明,若正确调谋,带动量的SGD在小批量设置下实际上可以与Adam相当。我们重新审视了解释Adam优势的现有理论,包括重尾类别不平衡、方向锋利性和Hessian异质性,这些理论在直接解释这一现象方面存在挑战。为了在理解上弥合这一差距,我们通过分析Transformer训练运行和受文献启发的简单二次模型,提供了新的见解,基于随机微分方程模型,阐述了批量大小对训练动力学的作用。
引用
@article{arxiv.2506.12543,
title = {Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling},
author = {Teodora Srećković and Jonas Geiping and Antonio Orvieto},
journal= {arXiv preprint arXiv:2506.12543},
year = {2025}
}
备注
Short version accepted at the 2025 HiLD Workshop at ICML