中文

Heavy-ball动量加速随机梯度下降中的隐式正则化

机器学习 2023-02-03 v1 最优化与控制

摘要

众所周知,梯度下降(GD)中的有限步长(hh)将解隐式正则化到更平坦的极小值。一个自然的问题是“在Heavy-ball(H.B)动量加速梯度下降(GD+M)中,动量参数β\beta是否在隐式正则化中起作用?”。为回答该问题,首先我们证明离散H.B动量更新(GD+M)遵循由修正损失诱导的连续轨迹,该损失由原始损失和一个隐式正则化项组成。然后,我们证明(GD+M)的隐式正则化项比(GD)强(1+β1β)(\frac{1+\beta}{1-\beta})倍,从而解释了为何(GD+M)比(GD)表现出更好的泛化性能和更高的测试精度。此外,我们将分析扩展到带动量的随机梯度下降(SGD+M),并在逐点意义上刻画了(SGD+M)更新的连续轨迹。我们通过一系列实验验证了理论,探究了(SGD+M)和(GD+M)中的隐式正则化。

关键词

引用

@article{arxiv.2302.00849,
  title  = {Implicit regularization in Heavy-ball momentum accelerated stochastic gradient descent},
  author = {Avrajit Ghosh and He Lyu and Xitong Zhang and Rongrong Wang},
  journal= {arXiv preprint arXiv:2302.00849},
  year   = {2023}
}