松弛光滑条件下非凸随机优化中自适应梯度算法的复杂度下界
机器学习
2025-05-09 v1 最优化与控制
摘要
非凸随机优化的最新结果表明,流行的自适应算法(如 AdaGrad)在 -光滑条件下收敛,但其收敛速率是关于问题参数(如光滑常数)的高阶多项式。此类算法为找到 -平稳点所保证的复杂度,可能远大于 SGD 在 -光滑设定下达到的最优复杂度 ,其中 为初始最优间隙, 为随机梯度的方差。然而,目前尚不清楚这些高阶依赖关系能否被收紧。为回答此问题,我们研究了 -光滑设定下几种自适应优化算法的复杂度下界,重点关注问题参数 的依赖关系。我们给出了 AdaGrad 三种变体的复杂度下界,表明其对问题参数 至少存在二次依赖。值得注意的是,我们证明了解相关变体 AdaGrad-Norm 至少需要 次随机梯度查询才能找到一个 -平稳点。我们还为使用一大类自适应步长的 SGD 提供了下界。我们的结果表明,对于某些自适应算法,就初始最优间隙和光滑常数而言,-光滑设定本质上比标准光滑设定更为困难。
引用
@article{arxiv.2505.04599,
title = {Complexity Lower Bounds of Adaptive Gradient Algorithms for Non-convex Stochastic Optimization under Relaxed Smoothness},
author = {Michael Crawshaw and Mingrui Liu},
journal= {arXiv preprint arXiv:2505.04599},
year = {2025}
}
备注
ICLR 2025