随机梯度噪声的非高斯性
机器学习
2019-10-28 v2 机器学习
摘要
是什么使得随机梯度下降(SGD)在神经网络训练中比梯度下降(GD)取得更好的泛化能力?这一问题已引起广泛关注。在本文中,我们研究训练过程中随机梯度噪声(SGN)向量的分布。我们观察到,对于批量大小 256 及以上,该分布在训练的早期阶段至少最好描述为高斯分布。这在不同的数据集、网络架构和其他选择下均成立。
引用
@article{arxiv.1910.09626,
title = {Non-Gaussianity of Stochastic Gradient Noise},
author = {Abhishek Panigrahi and Raghav Somani and Navin Goyal and Praneeth Netrapalli},
journal= {arXiv preprint arXiv:1910.09626},
year = {2019}
}