带标签噪声的 SGD 可证明偏好平坦的全局极小点
机器学习
2021-12-07 v2 信息论
math.IT
最优化与控制
机器学习
摘要
在过参数化模型中,随机梯度下降(SGD)中的噪声隐式正则化优化轨迹,并决定 SGD 收敛到哪个局部极小。受训练中使用噪声标签可改善泛化的实证研究启发,我们研究带标签噪声的 SGD 的隐式正则化效应。我们展示带标签噪声的 SGD 收敛到正则化损失 的驻点,其中 为训练损失, 为依赖于步长、标签噪声强度和批量大小的有效正则化参数, 为显式正则化项,惩罚尖锐极小。我们的分析揭示了大学习率超越线性缩放规则的额外正则化效应,其对 Hessian 大特征值的惩罚甚于小特征值。我们还证明了对使用一般损失函数的分类、带动量的 SGD 和带一般噪声协方差的 SGD 的推广,显著加强了 Blanc 等人先前关于全局收敛和大学习率的工作,以及 HaoChen 等人关于一般模型的工作。
引用
@article{arxiv.2106.06530,
title = {Label Noise SGD Provably Prefers Flat Global Minimizers},
author = {Alex Damian and Tengyu Ma and Jason D. Lee},
journal= {arXiv preprint arXiv:2106.06530},
year = {2021}
}
备注
57 pages, 5 figures, NeurIPS 2021