Heavy-ball动量加速随机梯度下降中的隐式正则化
机器学习
2023-02-03 v1 最优化与控制
摘要
众所周知,梯度下降(GD)中的有限步长()将解隐式正则化到更平坦的极小值。一个自然的问题是“在Heavy-ball(H.B)动量加速梯度下降(GD+M)中,动量参数是否在隐式正则化中起作用?”。为回答该问题,首先我们证明离散H.B动量更新(GD+M)遵循由修正损失诱导的连续轨迹,该损失由原始损失和一个隐式正则化项组成。然后,我们证明(GD+M)的隐式正则化项比(GD)强倍,从而解释了为何(GD+M)比(GD)表现出更好的泛化性能和更高的测试精度。此外,我们将分析扩展到带动量的随机梯度下降(SGD+M),并在逐点意义上刻画了(SGD+M)更新的连续轨迹。我们通过一系列实验验证了理论,探究了(SGD+M)和(GD+M)中的隐式正则化。
引用
@article{arxiv.2302.00849,
title = {Implicit regularization in Heavy-ball momentum accelerated stochastic gradient descent},
author = {Avrajit Ghosh and He Lyu and Xitong Zhang and Rongrong Wang},
journal= {arXiv preprint arXiv:2302.00849},
year = {2023}
}