中文

随机梯度下降中动力学稳定性的隐式正则化

机器学习 2023-06-02 v2 机器学习

摘要

在本文中,我们通过{\em 动力学稳定性}(Wu et al., 2018)的视角研究随机梯度下降(SGD)的隐式正则化。我们首先修正现有的 SGD 稳定性分析,展示 Hessian 的 Frobenius 范数与迹如何关联到不同的稳定性概念。值得注意的是,若一个全局极小点对于 SGD 是线性稳定的,则 Hessian 的迹必须小于或等于 2/η2/\eta,其中 η\eta 表示学习率。相比之下,对于梯度下降(GD),稳定性施加了类似约束,但仅针对 Hessian 的最大特征值。我们随后分析这些稳定极小点的泛化性质,特别关注两层 ReLU 网络和对角线性网络。值得注意的是,我们建立了这两种模型的锐度度量与某些参数范数之间的{\em 等价性},这使我们能够证明 SGD 的稳定极小点可证明地良好泛化。相比之下,GD 的稳定性诱导正则化可证明地过于微弱,无法确保满意的泛化。这一差异解释了为何 SGD 常比 GD 泛化得更好。请注意,学习率(LR)在稳定性诱导正则化的强度中起着关键作用。随着 LR 增大,正则化效应变得更加显著,阐明了为何具有更大 LR 的 SGD 始终展现出更优的泛化能力。此外,还提供了数值实验以支持我们的理论发现。

关键词

引用

@article{arxiv.2305.17490,
  title  = {The Implicit Regularization of Dynamical Stability in Stochastic Gradient Descent},
  author = {Lei Wu and Weijie J. Su},
  journal= {arXiv preprint arXiv:2305.17490},
  year   = {2023}
}

备注

ICML 2023 camera ready