中文

自适应梯度方法在重尾噪声下能否收敛?以 AdaGrad 为例

最优化与控制 2026-05-19 v1 机器学习 机器学习

摘要

在现代机器学习的许多任务中,观察到优化过程涉及重尾梯度噪声。为了处理这一现实且具挑战性的场景,诸如梯度裁剪和梯度归一化等新机制被引入,以确保一阶算法的收敛。然而,自适应梯度方法作为包含著名的 Adam\mathtt{Adam}AdamW\mathtt{AdamW} 的一类现代优化器,即使不进行上述任何额外操作也通常表现良好。因此,自然要问:自适应梯度方法在没有任何算法修改的情况下,能否在重尾噪声下收敛?在本工作中,我们通过研究自适应梯度方法的起源——特例 AdaGrad\mathtt{AdaGrad},迈出了回答这一问题的第一步。我们首次给出了当尾指数 pp 满足 4/3<p24/3<p\leq2 时,AdaGrad\mathtt{AdaGrad} 在非凸优化中的可证明收敛速率。值得注意的是,该结果无需 pp 的任何先验知识即可实现,因此对尾指数具有自适应性。此外,我们建立了一个依赖于算法的下界,表明现有的重尾优化极小化极大速率无法由 AdaGrad\mathtt{AdaGrad} 达到。最后,我们考虑了 AdaGrad-Norm\mathtt{AdaGrad}\text{-}\mathtt{Norm}(理论研究中的流行 AdaGrad\mathtt{AdaGrad} 变体),并证明了在额外温和假设下,对于任意 1<p21<p\leq2 均成立改进的速率。

关键词

引用

@article{arxiv.2605.18694,
  title  = {Can Adaptive Gradient Methods Converge under Heavy-Tailed Noise? A Case Study of AdaGrad},
  author = {Zijian Liu},
  journal= {arXiv preprint arXiv:2605.18694},
  year   = {2026}
}

备注

ICML 2026