中文

SGD 达到零损失后会发生什么?——一个数学框架

机器学习 2022-07-29 v4 机器学习

摘要

理解随机梯度下降(SGD)的隐式偏置是深度学习中的关键挑战之一,尤其是对于过参数化模型,其中损失函数 LL 的局部极小点可构成一个流形。直观上,在足够小的学习率 η\eta 下,SGD 跟踪梯度下降(GD)直至接近该流形,此时梯度噪声阻止进一步收敛。在此情形下,Blanc 等人(2020)证明了带标签噪声的 SGD 在局部降低一个类似正则项的量,即损失的锐度 tr[2L]\mathrm{tr}[\nabla^2 L]。本文通过借鉴 Katzenberger(1991)的思想,给出了此类分析的一般框架。它原则上允许使用描述参数极限动力学的随机微分方程(SDE)来完整刻画 SGD 在该流形附近的正则化效应——即“隐式偏置”——该方程由损失函数和噪声协方差共同决定。这给出了一些新结果:(1)对隐式偏置的全局分析,在 η2\eta^{-2} 步内有效,而 Blanc 等人(2020)的局部分析仅在 η1.6\eta^{-1.6} 步内有效;(2)允许任意噪声协方差。作为一个应用,我们展示了在任意大初始化下,标签噪声 SGD 总能逃出核 regime,并且仅需 O(κlnd)O(\kappa\ln d) 个样本即可在 Rd\mathbb{R}^d 中学习一个 κ\kappa-稀疏过参数化线性模型(Woodworth 等人,2020),而在核 regime 中初始化的 GD 需要 Ω(d)\Omega(d) 个样本。该上界是极小极大最优的,并改进了之前的 O~(κ2)\tilde{O}(\kappa^2) 上界(HaoChen 等人,2020)。

关键词

引用

@article{arxiv.2110.06914,
  title  = {What Happens after SGD Reaches Zero Loss? --A Mathematical Framework},
  author = {Zhiyuan Li and Tianhao Wang and Sanjeev Arora},
  journal= {arXiv preprint arXiv:2110.06914},
  year   = {2022}
}

备注

56 pages, 2 figures; ICLR 2022