中文

(加速)噪声自适应随机重球动量法

最优化与控制 2025-06-02 v3 机器学习 机器学习

摘要

随机重球动量法(SHB)常用于训练机器学习模型,通常比随机梯度下降有经验上的改进。我们主要关注强凸二次型,旨在更好地理解SHB的理论优势并随后改进该方法。对于强凸二次型,Kidambi等人(2018)表明,SHB(使用大小为1的小批量)无法达到加速收敛,因此相对于SGD没有理论优势。他们推测SHB的实际增益是使用更大批量带来的副产品。我们首先证实了这一说法,证明当批量大小超过一个依赖于条件数κ\kappa的阈值bb^*时,SHB可以达到加速速率。具体而言,我们证明,在与确定性设置相同的步长和动量参数下,使用足够大批量的SHB在2\ell_2范数下测量到最优解的距离时,可获得O(exp(Tκ)+σ)O\left(\exp(-\frac{T}{\sqrt{\kappa}}) + \sigma \right)的收敛速度,其中TT为迭代次数,σ2\sigma^2为随机梯度的方差。我们证明了一个下界,表明bb^*κ\kappa的依赖是必要的。为确保收敛到极小值点,我们设计了一种噪声自适应多阶段算法,在2\ell_2范数下测量到最优解的距离时,可获得O(exp(Tκ)+σT)O\left(\exp\left(-\frac{T}{\sqrt{\kappa}}\right) + \frac{\sigma}{\sqrt{T}}\right)的速率。我们还考虑了一般光滑强凸情形,并提出了首个噪声自适应SHB变体,在平方2\ell_2范数下测量到最优解的距离时,以O(exp(Tκ)+σ2T)O(\exp(-\frac{T}{\kappa}) + \frac{\sigma^2}{T})的速率收敛到极小值点。我们通过实验证明了所提算法的有效性。

关键词

引用

@article{arxiv.2401.06738,
  title  = {(Accelerated) Noise-adaptive Stochastic Heavy-Ball Momentum},
  author = {Anh Dang and Reza Babanezhad and Sharan Vaswani},
  journal= {arXiv preprint arXiv:2401.06738},
  year   = {2025}
}

备注

TMLR 2025