中文

关于 mSGD 与 AdaGrad 在随机优化中的收敛性

机器学习 2022-01-28 v1 最优化与控制

摘要

作为最基础的随机优化算法之一,随机梯度下降(SGD)在过去十年中被深入发展并广泛应用于机器学习。已有一些改进的 SGD 类算法,在收敛速度和精度方面于许多竞赛和应用中优于 SGD,例如基于动量的 SGD(mSGD)和自适应梯度算法(AdaGrad)。尽管取得了这些经验性成功,由于技术困难,这些算法的理论性质尚未得到很好确立。受此启发,我们聚焦于随机优化中任意光滑(可能非凸)损失函数下 mSGD 和 AdaGrad 的收敛性分析。首先,我们证明 mSGD 的迭代以概率 1 渐近收敛到一个平稳点的连通集,这比现有关于子序列收敛或时间平均收敛的工作更具一般性。此外,我们证明 mSGD 的损失函数以比 SGD 更快的一定速率衰减。另外,我们证明 AdaGrad 的迭代以概率 1 渐近收敛到一个平稳点的连通集。该结果也将文献中子序列收敛和时间平均收敛的结果进行了推广。尽管上述收敛结果具有一般性,我们放宽了关于梯度噪声、损失函数凸性以及迭代有界性的一些假设。

关键词

引用

@article{arxiv.2201.11204,
  title  = {On the Convergence of mSGD and AdaGrad for Stochastic Optimization},
  author = {Ruinan Jin and Yu Xing and Xingkang He},
  journal= {arXiv preprint arXiv:2201.11204},
  year   = {2022}
}