中文

在放宽假设下重新审视 AdaGrad 的收敛性

最优化与控制 2024-09-16 v2 机器学习 机器学习

摘要

在本研究中,我们重新审视了带动量的 AdaGrad(将 AdaGrad 作为特例)在非凸光滑优化问题上的收敛性。我们考虑了一个一般的噪声模型,其中噪声幅度由函数值间隙连同梯度幅度共同控制。该模型涵盖了包括有界噪声、次高斯噪声、仿射方差噪声和期望光滑性在内的广泛噪声,并且已被证明在许多实际应用中更为现实。我们的分析得出了一个概率收敛率,在一般噪声下可以达到 O~(1/T)\tilde{\mathcal{O}}(1/\sqrt{T})。该速率不依赖于问题参数的先验知识,并且当与函数值间隙和噪声水平相关的噪声参数足够小时,可以加速至 O~(1/T)\tilde{\mathcal{O}}(1/T),其中 TT 表示总迭代次数。因此,该收敛率在对数项以内匹配了非凸光滑环境下随机一阶方法的下界率 [Arjevani et al., 2023]。我们进一步推导了带动量的 AdaGrad 的收敛界,考虑了广义光滑性,其中局部光滑性由梯度范数的一阶函数控制。

关键词

引用

@article{arxiv.2402.13794,
  title  = {Revisiting Convergence of AdaGrad with Relaxed Assumptions},
  author = {Yusu Hong and Junhong Lin},
  journal= {arXiv preprint arXiv:2402.13794},
  year   = {2024}
}

备注

Accepted by UAI 2024