中文

深度神经网络随机梯度下降的重尾理论

机器学习 2019-12-03 v1 机器学习 经典分析与常微分方程

摘要

随机梯度下降(SGD)算法中的梯度噪声(GN)在大样本情形下常通过假设\emph{经典}中心极限定理(CLT)成立而被认为是高斯分布。这一假设常出于数学便利性而做出,因为它使得 SGD 可被分析为受布朗运动驱动的随机微分方程(SDE)。我们认为,高斯性假设在深度学习环境中可能不成立,从而使基于布朗运动的分析不再适用。受非高斯自然现象的启发,我们在更一般的背景下考虑 GN,并援引\emph{广义} CLT,其表明 GN 收敛于一个\emph{重尾}的 α\alpha-稳定随机向量,其中\emph{尾指数} α\alpha 决定了分布的重尾程度。相应地,我们提议将 SGD 分析为受 L\'{e}vy 运动驱动的 SDE 的离散化。此类 SDE 可能产生“跳跃”,迫使 SDE 及其离散化从窄极小值\emph{转移}到更宽的极小值,这已由现有的亚稳性理论以及我们近期证明的推广所证实。在本研究中,在 α\alpha-稳定 GN 假设下,我们进一步建立了 SGD 收敛到局部极小值的收敛速率与尾指数 α\alpha 之间的显式联系。为验证 α\alpha-稳定假设,我们在常见深度学习场景下开展实验,表明在所有设置中 GN 均高度非高斯且呈现重尾。我们考察了不同网络架构与规模、损失函数以及数据集下的尾部行为。我们的结果提供了一个不同的视角,并进一步阐明了 SGD 偏好宽极小值这一信念。

关键词

引用

@article{arxiv.1912.00018,
  title  = {On the Heavy-Tailed Theory of Stochastic Gradient Descent for Deep Neural Networks},
  author = {Umut Şimşekli and Mert Gürbüzbalaban and Thanh Huy Nguyen and Gaël Richard and Levent Sagun},
  journal= {arXiv preprint arXiv:1912.00018},
  year   = {2019}
}

备注

32 pages. arXiv admin note: substantial text overlap with arXiv:1901.06053