中文

随机梯度下降引入依赖于构型的等效正则化并偏好平坦解

无序系统与神经网络 2023-06-21 v1 机器学习

摘要

泛化是深度学习中最重要的问题之一。在神经网络的过参数化 regime 中,存在许多对训练数据拟合程度相当的低损失解。关键问题是哪个解具有更好的泛化能力。实证研究表明,解的损 landscapes 平坦度与其泛化能力之间存在强相关性,且随机梯度下降(SGD)在找到平坦解方面至关重要。为理解 SGD 如何将学习系统驱动至平坦解,我们构建了一个损失 landscape 具有连续退化(或近退化)极小点集合的简单模型。通过求解底层随机学习动力学的 Fokker-Planck 方程,我们表明,由于其强各向异性,SGD 噪声引入了一个额外的等效损失项,该项随平坦度减小,且总强度随学习率和 batch-to-batch 变化增大。我们发现额外的依赖于 landscape 的 SGD 损失打破了退化,并作为寻找平坦解的有效正则化。此外,更强的 SGD 噪声缩短了收敛到平坦解的时间。然而,我们确定了 SGD 噪声的一个上界,超过该上界系统无法收敛。我们的结果不仅阐明了 SGD 对泛化的作用,也可能对高效且无散度地学习中的超参数选择有重要意义。

关键词

引用

@article{arxiv.2206.01246,
  title  = {Stochastic gradient descent introduces an effective landscape-dependent regularization favoring flat solutions},
  author = {Ning Yang and Chao Tang and Yuhai Tu},
  journal= {arXiv preprint arXiv:2206.01246},
  year   = {2023}
}

备注

Main text: 11 pages, 3 figures; supplementary materials: 19 pages, 5 figures