中文

使用 Armijo 线搜索的随机梯度下降非凸优化中批量大小与所需步数之间的关系

机器学习 2024-02-02 v4 最优化与控制

摘要

虽然随机梯度下降(SGD)可以使用各种学习率,如常数或递减速率,但先前的数值结果表明,当 SGD 使用由线搜索方法给出的学习率时,其性能优于其他深度学习优化器。在本文中,我们对带有由 Armijo 线搜索给出的学习率的 SGD 进行非凸优化的收敛分析,表明当步数和批量大小较大时,全梯度平方范数期望的上界变小。接下来,我们证明,对于带有 Armijo 线搜索学习率的 SGD,非凸优化所需步数是批量大小的单调递减凸函数;即非凸优化所需步数随批量大小增加而减少。此外,我们证明随机一阶预言机(SFO)复杂度(即随机梯度计算成本)是批量大小的凸函数;即存在使 SFO 复杂度最小的临界批量大小。最后,我们提供了支持理论结果的数值结果。数值结果表明,训练深度神经网络所需步数随批量大小增加而减少,并且存在可从理论结果估计的临界批量大小。

关键词

引用

@article{arxiv.2307.13831,
  title  = {Relationship between Batch Size and Number of Steps Needed for Nonconvex Optimization of Stochastic Gradient Descent using Armijo Line Search},
  author = {Yuki Tsukada and Hideaki Iiduka},
  journal= {arXiv preprint arXiv:2307.13831},
  year   = {2024}
}