自适应梯度方法在重尾噪声下能否收敛?以 AdaGrad 为例
最优化与控制
2026-05-19 v1 机器学习
机器学习
摘要
在现代机器学习的许多任务中,观察到优化过程涉及重尾梯度噪声。为了处理这一现实且具挑战性的场景,诸如梯度裁剪和梯度归一化等新机制被引入,以确保一阶算法的收敛。然而,自适应梯度方法作为包含著名的 和 的一类现代优化器,即使不进行上述任何额外操作也通常表现良好。因此,自然要问:自适应梯度方法在没有任何算法修改的情况下,能否在重尾噪声下收敛?在本工作中,我们通过研究自适应梯度方法的起源——特例 ,迈出了回答这一问题的第一步。我们首次给出了当尾指数 满足 时, 在非凸优化中的可证明收敛速率。值得注意的是,该结果无需 的任何先验知识即可实现,因此对尾指数具有自适应性。此外,我们建立了一个依赖于算法的下界,表明现有的重尾优化极小化极大速率无法由 达到。最后,我们考虑了 (理论研究中的流行 变体),并证明了在额外温和假设下,对于任意 均成立改进的速率。
引用
@article{arxiv.2605.18694,
title = {Can Adaptive Gradient Methods Converge under Heavy-Tailed Noise? A Case Study of AdaGrad},
author = {Zijian Liu},
journal= {arXiv preprint arXiv:2605.18694},
year = {2026}
}
备注
ICML 2026