使用常数和衰减学习率的随机梯度下降的迭代复杂度和随机一阶预言复杂度
机器学习
2024-02-26 v1 机器学习
摘要
随机梯度下降(SGD)是训练深度神经网络的最简单一阶优化器,其性能不仅取决于学习率,还取决于批量大小。两者都影响训练所需的迭代次数和随机一阶预言(SFO)复杂度。特别是,先前的数值结果表明,对于使用常数学习率的SGD,当批量大小增加时,训练所需的迭代次数减少,而训练所需的SFO复杂度在临界批量大小处最小化,并且一旦批量大小超过该值,SFO复杂度就会增加。在此,我们研究了在深度学习的非凸优化中,使用常数或衰减学习率的SGD的批量大小与迭代和SFO复杂度之间的关系,并表明使用临界批量大小的SGD最小化了SFO复杂度。我们还提供了SGD与现有的一阶优化器的数值比较,并展示了使用临界批量大小的SGD的有用性。此外,我们表明测量的临界批量大小接近从我们的理论结果估计的大小。
引用
@article{arxiv.2402.15344,
title = {Iteration and Stochastic First-order Oracle Complexities of Stochastic Gradient Descent using Constant and Decaying Learning Rates},
author = {Kento Imaizumi and Hideaki Iiduka},
journal= {arXiv preprint arXiv:2402.15344},
year = {2024}
}
备注
The latest version was updated on Feb. 23. arXiv admin note: text overlap with arXiv:2307.13831