中文

过参数化设定下动量随机梯度下降的指数收敛速率

最优化与控制 2024-11-07 v2 机器学习 概率论 机器学习

摘要

我们证明了在非凸优化背景下,对于任意固定的超参数(学习率、摩擦参数)及其连续时间对应形式,动量随机梯度下降方案(MSGD)指数收敛速率的显式界。在小步长机制下,以及对于平坦极小值或强噪声强度的情况,这些界证明了 MSGD 相比普通随机梯度下降(SGD)具有更快的收敛。结果针对满足局部 Polyak-Lojasiewicz 不等式的目标函数给出,并基于在过参数化设定下得到满足的关于 MSGD 方差的假设。此外,我们分析了摩擦参数的最优选择,并证明 MSGD 过程几乎必然收敛到局部极小值。

关键词

引用

@article{arxiv.2302.03550,
  title  = {Exponential convergence rates for momentum stochastic gradient descent in the overparametrized setting},
  author = {Benjamin Gess and Sebastian Kassing},
  journal= {arXiv preprint arXiv:2302.03550},
  year   = {2024}
}