SGD:隐式正则化、批量大小与多轮迭代的作用
机器学习
2021-07-13 v1 人工智能
摘要
多轮、小批量随机梯度下降(SGD)一直是学习大型过参数化模型的首选方法。一种解释 SGD 在实践中有良好表现的通行理论是:该算法具有隐式正则化,使其输出偏向良好解。或许理论上理解最透彻的 SGD 学习设定是随机凸优化(SCO),众所周知 SGD 以 的速率学习,其中 为样本数。本文考虑 SCO 问题,并探究隐式正则化、批量大小与多轮迭代对 SGD 的作用。我们的主要贡献有三方面:(a)我们证明对任意正则化器,存在一个 SCO 问题使得正则化经验风险最小化失败。(这自动排除了任何基于隐式正则化对 SGD 成功的解释。)(b)我们在样本复杂度上给出了 SGD 与通过经验损失梯度下降(GD)学习的分离。我们证明存在一个 SCO 问题,使得 GD 以任意步长与迭代次数只能以次优速率学习:至少 。(c)我们提出实践中常用的 SGD 多轮变体。我们证明该算法在最坏情况下至少与单遍 SGD 一样好。然而,对某些 SCO 问题,对数据集进行多遍遍历可显著优于单遍 SGD。我们将结果推广到一般学习设定,给出一个对任意数据分布可学习的问题,且对该问题,SGD 对于任意正则化函数都严格优于 RERM。最后我们讨论了结果对深度学习的启示,并展示了两层对角神经网络上 SGD 与 ERM 的分离。
引用
@article{arxiv.2107.05074,
title = {SGD: The Role of Implicit Regularization, Batch-size and Multiple-epochs},
author = {Satyen Kale and Ayush Sekhari and Karthik Sridharan},
journal= {arXiv preprint arXiv:2107.05074},
year = {2021}
}