中文

超越一致平滑性:自适应 SGD 的停止时间分析

机器学习 2023-02-14 v1 机器学习 最优化与控制

摘要

本工作考虑使用随机梯度预言机寻找非凸函数的一阶平稳点的问题,该函数可能具有无界的平滑常数。我们关注由 Zhang 等人(ICLR'20)提出的 (L0,L1)(L_0,L_1)-平滑函数类。经验证据表明,与普遍存在的 L0L_0-平滑性相比,这些函数更贴近实际机器学习问题。该类足够丰富以包含高度非平滑函数,例如 exp(L1x)\exp(L_1 x),它是 (0,O(L1))(0,\mathcal{O}(L_1))-平滑的。尽管具有丰富性,新兴的一系列工作在随机梯度噪声被确定性且一致有界时实现了 O~(1T)\widetilde{\mathcal{O}}(\frac{1}{\sqrt{T}}) 的收敛速率。该噪声限制在 L0L_0-平滑设定中并不需要,且在许多实际设定中要么不满足,要么导致相对于收敛速率噪声缩放的较弱收敛速率。我们开发了一种技术,使我们能在不假设噪声支撑一致有界的情况下证明 (L0,L1)(L_0,L_1)-平滑函数的 O(polylog(T)T)\mathcal{O}(\frac{\mathrm{poly}\log(T)}{\sqrt{T}}) 收敛速率。我们结果背后的关键创新是一个精心构造的停止时间 τ\tau,它在平均意义上同时“大”,又允许我们将 τ\tau 之前的自适应步长视为(大致)独立于梯度。对于一般的 (L0,L1)(L_0,L_1)-平滑函数,我们的分析要求乘性噪声参数 σ1<1\sigma_1 < 1 的温和限制。对于 (L0,L1)(L_0,L_1)-平滑函数的一个广泛子类,当 σ11\sigma_1 \geq 1 时我们的收敛速率仍然成立。相比之下,我们证明先前工作分析的许多算法在 (L0,L1)(L_0,L_1)-平滑优化中,即使对于平滑且强凸函数,当 σ1>1\sigma_1 > 1 时也会以恒定概率发散。

关键词

引用

@article{arxiv.2302.06570,
  title  = {Beyond Uniform Smoothness: A Stopped Analysis of Adaptive SGD},
  author = {Matthew Faw and Litu Rout and Constantine Caramanis and Sanjay Shakkottai},
  journal= {arXiv preprint arXiv:2302.06570},
  year   = {2023}
}