坏全局极小值的存在性以及 SGD 能够到达它们
机器学习
2021-02-24 v2 机器学习
摘要
若干工作旨在解释为何过参数化神经网络在随机梯度下降(SGD)训练下泛化良好。已形成的共识解释将 SGD 的随机性归功于训练过程偏向于低复杂度模型,从而带来隐式正则化。我们在常见深度神经网络架构的图像分类背景下仔细审视这一解释。我们发现,如果不进行\emph{显式}正则化,那么 SGD 可以轻易地被使得收敛到泛化差、高复杂度的模型:只需先在数据的随机标签上训练,再切换到用正确标签进行恰当训练。相反,我们发现存在显式正则化时,用随机标签预训练对 SGD 没有有害影响。我们相信我们的结果提供了证据,表明显式正则化在过参数化神经网络成功中的作用远比目前所理解的更为重要。具体而言,通过独立于数据拟合程度地惩罚复杂模型,正则化也影响了远离最优解处的训练动力学,使得拟合数据良好的简单模型可被局部方法(如 SGD)发现。
引用
@article{arxiv.1906.02613,
title = {Bad Global Minima Exist and SGD Can Reach Them},
author = {Shengchao Liu and Dimitris Papailiopoulos and Dimitris Achlioptas},
journal= {arXiv preprint arXiv:1906.02613},
year = {2021}
}