过参数化设定下动量随机梯度下降的指数收敛速率
最优化与控制
2024-11-07 v2 机器学习
概率论
机器学习
摘要
我们证明了在非凸优化背景下,对于任意固定的超参数(学习率、摩擦参数)及其连续时间对应形式,动量随机梯度下降方案(MSGD)指数收敛速率的显式界。在小步长机制下,以及对于平坦极小值或强噪声强度的情况,这些界证明了 MSGD 相比普通随机梯度下降(SGD)具有更快的收敛。结果针对满足局部 Polyak-Lojasiewicz 不等式的目标函数给出,并基于在过参数化设定下得到满足的关于 MSGD 方差的假设。此外,我们分析了摩擦参数的最优选择,并证明 MSGD 过程几乎必然收敛到局部极小值。
引用
@article{arxiv.2302.03550,
title = {Exponential convergence rates for momentum stochastic gradient descent in the overparametrized setting},
author = {Benjamin Gess and Sebastian Kassing},
journal= {arXiv preprint arXiv:2302.03550},
year = {2024}
}