中文

带标签噪声的 SGD 可证明偏好平坦的全局极小点

机器学习 2021-12-07 v2 信息论 math.IT 最优化与控制 机器学习

摘要

在过参数化模型中,随机梯度下降(SGD)中的噪声隐式正则化优化轨迹,并决定 SGD 收敛到哪个局部极小。受训练中使用噪声标签可改善泛化的实证研究启发,我们研究带标签噪声的 SGD 的隐式正则化效应。我们展示带标签噪声的 SGD 收敛到正则化损失 L(θ)+λR(θ)L(\theta) +\lambda R(\theta) 的驻点,其中 L(θ)L(\theta) 为训练损失,λ\lambda 为依赖于步长、标签噪声强度和批量大小的有效正则化参数,R(θ)R(\theta) 为显式正则化项,惩罚尖锐极小。我们的分析揭示了大学习率超越线性缩放规则的额外正则化效应,其对 Hessian 大特征值的惩罚甚于小特征值。我们还证明了对使用一般损失函数的分类、带动量的 SGD 和带一般噪声协方差的 SGD 的推广,显著加强了 Blanc 等人先前关于全局收敛和大学习率的工作,以及 HaoChen 等人关于一般模型的工作。

关键词

引用

@article{arxiv.2106.06530,
  title  = {Label Noise SGD Provably Prefers Flat Global Minimizers},
  author = {Alex Damian and Tengyu Ma and Jason D. Lee},
  journal= {arXiv preprint arXiv:2106.06530},
  year   = {2021}
}

备注

57 pages, 5 figures, NeurIPS 2021