中文

广义与 $(L_0, L_1)$-光滑性下加速梯度法的近最优收敛性

最优化与控制 2026-05-22 v2 机器学习

摘要

我们研究满足最近提出的 \ell-光滑性条件 2f(x)(f(x))||\nabla^{2}f(x)|| \le \ell\left(||\nabla f(x)||\right) 的凸优化问题的一阶方法,该条件推广了 LL-光滑性和 (L0,L1)(L_{0},L_{1})-光滑性。已知在 LL-光滑性下,加速梯度下降法 (AGD) 可达到最优复杂度 O(LR/ε)O(\sqrt{L} R / \sqrt{\varepsilon}),其中 ε\varepsilon 是误差容限,RR 是起点与最优点之间的距离。然而,现有的对 \ell-光滑性的扩展要么对初始梯度产生额外依赖,要么受到 L1RL_{1} R 的指数因子影响,要么需要昂贵的辅助子程序,这留下了一个悬而未决的问题:即使在 (L0,L1)(L_{0},L_{1})-光滑性情况下,对于小 ε\varepsilon,是否可能达到 AGD 类型的 O((0)R/ε)O(\sqrt{\ell(0)} R / \sqrt{\varepsilon}) 速率。我们解决了这个悬而未决的问题。利用新的 Lyapunov 函数并设计新算法,我们针对小 ε\varepsilon 和几乎任意的 \ell 实现了 O((0)R/ε)O(\sqrt{\ell(0)} R / \sqrt{\varepsilon}) 的 oracle 复杂度。例如,对于 (L0,L1)(L_{0},L_{1})-光滑性,我们的界 O(L0R/ε)O(\sqrt{L_0} R / \sqrt{\varepsilon}) 在小 ε\varepsilon 区域是可证明最优的,并消除了先前加速算法中存在的所有非常数乘法因子。

关键词

引用

@article{arxiv.2508.06884,
  title  = {Near-Optimal Convergence of Accelerated Gradient Methods under Generalized and $(L_0, L_1)$-Smoothness},
  author = {Alexander Tyurin},
  journal= {arXiv preprint arXiv:2508.06884},
  year   = {2026}
}