关于深度学习的大批量训练:泛化差距与尖锐极小值
机器学习
2017-02-13 v2 最优化与控制
摘要
随机梯度下降 (SGD) 方法及其变体是许多深度学习任务的首选算法。这些方法在小批量机制下运行,即采样训练数据的一小部分(例如 - 个数据点)来计算梯度的近似值。实践中观察到,当使用较大的批量时,模型的质量会下降,这由其泛化能力来衡量。我们研究了大批量机制下这种泛化下降的原因,并提出了支持以下观点的数值证据:大批量方法倾向于收敛到训练和测试函数的尖锐极小值——正如众所周知的那样,尖锐极小值会导致较差的泛化能力。相比之下,小批量方法始终收敛到平坦的极小值,我们的实验支持一个普遍的观点,即这是由于梯度估计中固有的噪声造成的。我们讨论了几种策略,试图帮助大批量方法消除这种泛化差距。
引用
@article{arxiv.1609.04836,
title = {On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima},
author = {Nitish Shirish Keskar and Dheevatsa Mudigere and Jorge Nocedal and Mikhail Smelyanskiy and Ping Tak Peter Tang},
journal= {arXiv preprint arXiv:1609.04836},
year = {2017}
}
备注
Accepted as a conference paper at ICLR 2017