中文

深度学习优化器非凸优化所需步数为批大小的有理函数

最优化与控制 2021-08-27 v1 机器学习

摘要

最近,针对非凸优化的深度学习优化器的收敛性及收敛速率分析已被广泛研究。同时,对优化器的数值评估精确阐明了训练深度神经网络所需的步数与批大小之间的关系。本文的主要贡献是从理论上证明,每个优化器进行非凸优化所需的步数可以表示为批大小的有理函数。得到这些有理函数后可得出两个特别重要的事实,这在以往研究中已得到数值验证。第一个事实是,存在一个最优批大小,使得非凸优化所需的步数最小化。这意味着使用比最优批大小更大的批大小不会减少非凸优化所需的步数。第二个事实是,最优批大小取决于优化器。具体而言,理论上表明动量和 Adam 型优化器比随机梯度下降优化器能够利用更大的最优批次,并进一步减少非凸优化所需的最小步数。

关键词

引用

@article{arxiv.2108.11713,
  title  = {The Number of Steps Needed for Nonconvex Optimization of a Deep Learning Optimizer is a Rational Function of Batch Size},
  author = {Hideaki Iiduka},
  journal= {arXiv preprint arXiv:2108.11713},
  year   = {2021}
}