同时增加批量大小与学习率可加速随机梯度下降
机器学习
2025-02-17 v4 最优化与控制
摘要
小批量随机梯度下降 (SGD) 的性能在很大程度上取决于设置批量大小和学习率,以最小化训练深度神经网络时的经验损失。在本文中,我们对使用四种调度器的小批量 SGD 进行了理论分析:(i) 恒定批量大小与衰减学习率调度器,(ii) 增加批量大小与衰减学习率调度器,(iii) 增加批量大小与增加学习率调度器,以及 (iv) 增加批量大小与预热衰减学习率调度器。我们证明,使用调度器 (i) 的小批量 SGD 并不总能最小化经验损失的全梯度范数的期望,而使用调度器 (ii)、(iii) 和 (iv) 中的任何一个则可以。此外,调度器 (iii) 和 (iv) 能够加速小批量 SGD。本文还提供了支持性分析的数值结果,表明使用调度器 (iii) 或 (iv) 比使用调度器 (i) 或 (ii) 能更快地最小化经验损失的全梯度范数。
引用
@article{arxiv.2409.08770,
title = {Increasing Both Batch Size and Learning Rate Accelerates Stochastic Gradient Descent},
author = {Hikaru Umeda and Hideaki Iiduka},
journal= {arXiv preprint arXiv:2409.08770},
year = {2025}
}
备注
TMLR 2025