中文

随机梯度方法在梯度支配条件下几乎 surely 收敛速率

机器学习 2025-03-18 v3 最优化与控制

摘要

随机梯度方法是训练机器学习问题中最重要的算法之一。虽然诸如强凸性等经典假设允许简单分析,但在实际应用中很少满足。在近年,全局和局部梯度支配属性已被证明是强凸性更真实的替代方案。它们在诸如(简单)强化学习中的策略梯度方法以及带解析激活函数的深度神经网络训练中被证明成立。我们在全局和局部 β\beta 梯度支配假设下,证明了随机梯度下降(带或不带动量)的最后一步几乎 surely 收敛速率为 f(Xn)fo(n14β1+ϵ)f(X_n)-f^*\in o\big( n^{-\frac{1}{4\beta-1}+\epsilon}\big)。这些几乎 surely 的收敛速率接近最近的期望收敛速率。最后,我们展示了如何将结果应用于监督学习和强化学习中的训练任务。

关键词

引用

@article{arxiv.2405.13592,
  title  = {Almost sure convergence rates of stochastic gradient methods under gradient domination},
  author = {Simon Weissmann and Sara Klein and Waïss Azizian and Leif Döring},
  journal= {arXiv preprint arXiv:2405.13592},
  year   = {2025}
}