关于随机梯度下降中噪声带来的泛化益处
机器学习
2020-06-29 v1 机器学习
摘要
长期以来有人认为,在深度神经网络中,小批量随机梯度下降比大批量梯度下降具有更好的泛化能力。然而近期论文质疑该主张,认为此效应仅是大批量时超参数调优次优或计算预算不足的后果。本文在一系列流行模型上进行了精心设计的实验与严格的超参数扫描,证实小或中等批量在测试集上可大幅优于极大批量。即便两者训练相同迭代次数且大批量取得更小训练损失,此现象依然存在。我们的结果确认随机梯度中的噪声可增强泛化。我们研究了最优学习率调度如何随 epoch 预算增长而变化,并基于 SGD 动力学的随机微分方程视角给出了对观察结果的理论解释。
引用
@article{arxiv.2006.15081,
title = {On the Generalization Benefit of Noise in Stochastic Gradient Descent},
author = {Samuel L. Smith and Erich Elsen and Soham De},
journal= {arXiv preprint arXiv:2006.15081},
year = {2020}
}
备注
Camera-ready version of ICML 2020