中文

解构SGD中隐式正则化的作用机制

机器学习 2022-11-30 v1

摘要

已有若干相互竞争的假说用于解释为何小批量随机梯度下降(SGD)相比全批量设定能改善泛化,近期工作将其归因于训练过程中各种量的隐式正则化。然而迄今,评估这些假说解释力的经验证据仍然缺乏。本文开展广泛的实证评估,聚焦于各种理论机制缩小小批量到大批量泛化差距的能力。此外,我们刻画了SGD被认为(隐式)正则化的量在训练过程中的变化。通过使用微批量(即每个mini-batch的不相交更小子集),我们在经验上表明,在大批量设定中显式惩罚基于微批量平均的梯度范数或Fisher信息矩阵迹可恢复小批量SGD泛化,而基于Jacobian的正则化则无法做到。该泛化性能常与被正则化模型的梯度范数与小批量SGD的相似程度相关。我们还表明当微批量尺寸接近批量尺寸时此行为失效。最后我们注意到,在此类研究中,CIFAR10上的正向实验发现常在CIFAR100等其他数据集上反转,凸显了在更宽数据集集合上检验假说的必要。

关键词

引用

@article{arxiv.2211.15853,
  title  = {Disentangling the Mechanisms Behind Implicit Regularization in SGD},
  author = {Zachary Novack and Simran Kaur and Tanya Marwah and Saurabh Garg and Zachary C. Lipton},
  journal= {arXiv preprint arXiv:2211.15853},
  year   = {2022}
}

备注

Accepted as Spotlight at the NeurIPS 2022 Workshop for Higher Order Optimization in Machine Learning