面向随机梯度下降中大批量训练的理论理解
机器学习
2018-12-04 v1 机器学习
摘要
随机梯度下降(SGD)几乎被用于训练非凸优化任务。最近,Keskar等人[2017]提出的“大批量方法倾向于收敛到尖锐极小点”的假设受到了越来越多的关注。我们通过给出SGD在有限时间和渐近两种状态下的新性质,从理论上证明了这一假设。具体而言,我们给出了有限时间状态下SGD逃离局部极小点的显式逃逸时间,并证明SGD在渐近状态下(尽管可能需要指数时间收敛)倾向于收敛到更平坦的极小点,而与批量大小无关。我们还发现,具有更大学习率与批量大小之比的SGD倾向于更快地收敛到平坦极小点,然而,其泛化性能可能不如具有更小学习率与批量大小之比的SGD。我们包含了数值实验以佐证这些理论发现。
引用
@article{arxiv.1812.00542,
title = {Towards Theoretical Understanding of Large Batch Training in Stochastic Gradient Descent},
author = {Xiaowu Dai and Yuhua Zhu},
journal= {arXiv preprint arXiv:1812.00542},
year = {2018}
}