SGD 达到零损失后会发生什么?——一个数学框架
机器学习
2022-07-29 v4 机器学习
摘要
理解随机梯度下降(SGD)的隐式偏置是深度学习中的关键挑战之一,尤其是对于过参数化模型,其中损失函数 的局部极小点可构成一个流形。直观上,在足够小的学习率 下,SGD 跟踪梯度下降(GD)直至接近该流形,此时梯度噪声阻止进一步收敛。在此情形下,Blanc 等人(2020)证明了带标签噪声的 SGD 在局部降低一个类似正则项的量,即损失的锐度 。本文通过借鉴 Katzenberger(1991)的思想,给出了此类分析的一般框架。它原则上允许使用描述参数极限动力学的随机微分方程(SDE)来完整刻画 SGD 在该流形附近的正则化效应——即“隐式偏置”——该方程由损失函数和噪声协方差共同决定。这给出了一些新结果:(1)对隐式偏置的全局分析,在 步内有效,而 Blanc 等人(2020)的局部分析仅在 步内有效;(2)允许任意噪声协方差。作为一个应用,我们展示了在任意大初始化下,标签噪声 SGD 总能逃出核 regime,并且仅需 个样本即可在 中学习一个 -稀疏过参数化线性模型(Woodworth 等人,2020),而在核 regime 中初始化的 GD 需要 个样本。该上界是极小极大最优的,并改进了之前的 上界(HaoChen 等人,2020)。
引用
@article{arxiv.2110.06914,
title = {What Happens after SGD Reaches Zero Loss? --A Mathematical Framework},
author = {Zhiyuan Li and Tianhao Wang and Sanjeev Arora},
journal= {arXiv preprint arXiv:2110.06914},
year = {2022}
}
备注
56 pages, 2 figures; ICLR 2022