中文

随机梯度噪声的非高斯性

机器学习 2019-10-28 v2 机器学习

摘要

是什么使得随机梯度下降(SGD)在神经网络训练中比梯度下降(GD)取得更好的泛化能力?这一问题已引起广泛关注。在本文中,我们研究训练过程中随机梯度噪声(SGN)向量的分布。我们观察到,对于批量大小 256 及以上,该分布在训练的早期阶段至少最好描述为高斯分布。这在不同的数据集、网络架构和其他选择下均成立。

关键词

引用

@article{arxiv.1910.09626,
  title  = {Non-Gaussianity of Stochastic Gradient Noise},
  author = {Abhishek Panigrahi and Raghav Somani and Navin Goyal and Praneeth Netrapalli},
  journal= {arXiv preprint arXiv:1910.09626},
  year   = {2019}
}