AdaGrad 在随机非凸优化中的可证复杂度提升:上界与下界
最优化与控制
2025-06-09 v3 机器学习
机器学习
摘要
自适应梯度方法,如 AdaGrad,是神经网络训练中最成功的优化算法之一。虽然这些方法已知在具有良好几何结构的随机凸优化中相对于随机梯度下降 (SGD) 实现更好的维数依赖性,但其在随机非凸优化中的成功理论依据仍然尚不清晰。事实上,在梯度 Lipschitz 连续且噪声方差有界的标准假设下,已知 SGD 在寻找关于 -范的近平稳点方面是最坏情况次优的,这进一步表明不可能获得进一步的改进。为了回应这一局限,本文引入了对目标函数和梯度噪声方差的细化假设,这些假设更适合自适应梯度方法的坐标无关性。此外,我们采用 -范的梯度作为稳定性度量,区别于标准的 -范,以契合坐标无关分析并为 AdaGrad 获得更紧的收敛保证。在这些新假设和 -范稳定性度量下,我们为 AdaGrad 建立收敛率的上界,并为相应的 SGD 给出下界。特别是,我们识别出 AdaGrad 在计算复杂度上优于 SGD 的非凸情形,并展示在特定问题参数配置下,AdaGrad 相对于 SGD 可提高 倍,其中 为问题维数。据我们所知,这是首次在非凸情境下证明自适应梯度方法相对于 SGD 的可证明优势。我们还呈现了支持性下界,包括一个特定于 AdaGrad 的下界以及一个适用于一般确定性一阶方法的下界,表明我们的 AdaGrad 上界在某些条件下是紧密且不可改进的。
引用
@article{arxiv.2406.04592,
title = {Provable Complexity Improvement of AdaGrad over SGD: Upper and Lower Bounds in Stochastic Non-Convex Optimization},
author = {Ruichen Jiang and Devyani Maladkar and Aryan Mokhtari},
journal= {arXiv preprint arXiv:2406.04592},
year = {2025}
}
备注
34 pages, accepted to COLT 2025