增大批量大小改善带动量的随机梯度下降收敛性
机器学习
2025-09-25 v2
摘要
带动量的随机梯度下降(SGDM)即在 SGD 中加入动量项,已在理论和实践中得到广泛研究。理论研究表明,学习率和动量权重的设置会影响 SGDM 的收敛性。而实践研究又表明,批量大小的设置对 SGDM 的性能影响很大。本文我们关注使用恒定学习率和恒定动量权重的 mini-batch SGDM,这是训练深度神经网络时常用的做法。我们在理论上表明,使用恒定批量大小并不一定能最小化训练深度神经网络时全梯度范数期望值,而使用递增批量大小则 definitely 能最小化该期望值;也就是说,递增批量大小可以改善 mini-batch SGDM 的收敛性。我们还提供了数值结果支持我们的分析,具体表明,与使用恒定批量大小相比,mini-batch SGDM 使用递增批量大小对 stationary points 的收敛更快,同时还减少了计算成本。用于数值实验的 Python 实现已提供,地址为 https://github.com/iiduka-researches/NSHB_increasing_batchsize_acml25/。
关键词
引用
@article{arxiv.2501.08883,
title = {Increasing Batch Size Improves Convergence of Stochastic Gradient Descent with Momentum},
author = {Keisuke Kamo and Hideaki Iiduka},
journal= {arXiv preprint arXiv:2501.08883},
year = {2025}
}
备注
Accepted at ACML 2025, 34 pages