中文

松弛光滑条件下非凸随机优化中自适应梯度算法的复杂度下界

机器学习 2025-05-09 v1 最优化与控制

摘要

非凸随机优化的最新结果表明,流行的自适应算法(如 AdaGrad)在 (L0,L1)(L_0, L_1)-光滑条件下收敛,但其收敛速率是关于问题参数(如光滑常数)的高阶多项式。此类算法为找到 ϵ\epsilon-平稳点所保证的复杂度,可能远大于 SGD 在 LL-光滑设定下达到的最优复杂度 Θ(ΔLσ2ϵ4)\Theta \left( \Delta L \sigma^2 \epsilon^{-4} \right),其中 Δ\Delta 为初始最优间隙,σ2\sigma^2 为随机梯度的方差。然而,目前尚不清楚这些高阶依赖关系能否被收紧。为回答此问题,我们研究了 (L0,L1)(L_0, L_1)-光滑设定下几种自适应优化算法的复杂度下界,重点关注问题参数 Δ,L0,L1\Delta, L_0, L_1 的依赖关系。我们给出了 AdaGrad 三种变体的复杂度下界,表明其对问题参数 Δ,L0,L1\Delta, L_0, L_1 至少存在二次依赖。值得注意的是,我们证明了解相关变体 AdaGrad-Norm 至少需要 Ω(Δ2L12σ2ϵ4)\Omega \left( \Delta^2 L_1^2 \sigma^2 \epsilon^{-4} \right) 次随机梯度查询才能找到一个 ε\varepsilon-平稳点。我们还为使用一大类自适应步长的 SGD 提供了下界。我们的结果表明,对于某些自适应算法,就初始最优间隙和光滑常数而言,(L0,L1)(L_0, L_1)-光滑设定本质上比标准光滑设定更为困难。

关键词

引用

@article{arxiv.2505.04599,
  title  = {Complexity Lower Bounds of Adaptive Gradient Algorithms for Non-convex Stochastic Optimization under Relaxed Smoothness},
  author = {Michael Crawshaw and Mingrui Liu},
  journal= {arXiv preprint arXiv:2505.04599},
  year   = {2025}
}

备注

ICLR 2025