中文

随机梯度下降与随机重球法的几乎必然收敛速率

机器学习 2021-02-08 v2 最优化与控制 机器学习

摘要

我们针对一般随机逼近问题,研究了随机梯度下降(SGD)和随机重球法(SHB,也称为动量法)。对于 SGD,在凸且光滑的设置下,我们首次给出了迭代加权平均的几乎必然渐近收敛速率。更精确地说,我们证明了函数值的收敛速率可任意接近 o(1/k)o(1/\sqrt{k}),并且在所谓的过参数化情形下恰好为 o(1/k)o(1/k)。我们证明了这些结果在使用随机线搜索和随机 Polyak 步长时仍然成立,从而首次给出了这些方法在非过参数化情形下的收敛性证明。通过一种本质上不同的分析,我们证明了这些速率对 SHB 同样成立,但针对的是最后一次迭代。这一区别很重要,因为实践中使用的正是 SGD 和 SHB 的最后一次迭代。我们还证明了 SHB 的最后一次迭代几乎必然收敛到一个极小值点。此外,我们证明了确定性 HB 的函数值以 o(1/k)o(1/k) 的速率收敛,这比之前已知的 O(1/k)O(1/k) 更快。最后,在非凸设置下,我们证明了 SGD 轨迹上最低梯度范数的类似速率。

关键词

引用

@article{arxiv.2006.07867,
  title  = {Almost sure convergence rates for Stochastic Gradient Descent and Stochastic Heavy Ball},
  author = {Othmane Sebbouh and Robert M. Gower and Aaron Defazio},
  journal= {arXiv preprint arXiv:2006.07867},
  year   = {2021}
}