中文

SGD 最终迭代的收敛速率:维度依赖性分析

最优化与控制 2021-06-29 v1 机器学习 机器学习

摘要

随机梯度下降(SGD)是优化中最简单且最流行的方法之一。SGD 的收敛速率已被广泛研究,对运行平均格式的紧分析已建立,但最终迭代的次优性仍未被很好理解。shamir2013stochastic 给出了 SGD 最小化非光滑凸函数最终迭代的最佳已知上界,对 Lipschitz 凸函数为 O(log T/√T),在强凸性附加假设下为 O(log T/T)。然而,最佳已知下界比上界差一个 log T 因子。harvey2019tight 给出了匹配的下界,但其构造要求维度 d = T。随后 koren2020open 提问如何在常数维度设定下刻画 SGD 的最终迭代收敛。在本文中,我们在更一般的任意 d ≤ T 设定下回答该问题,证明了在标准步长调度下,SGD 最终迭代在最小化非光滑 Lipschitz 凸函数和强凸函数时的次优性分别有 Ω(log d/√T) 和 Ω(log d/T) 下界。我们的结果提供了关于 SGD 最终迭代收敛的第一个通用维度相关下界,部分解决了 koren2020open 提出的 COLT 开放问题。我们还给出进一步证据,表明一维中的正确速率应为 Θ(1/√T),例如对比 koren2020open 更一般设定下的一维特例给出了紧的 O(1/√T) 上界的证明。

关键词

引用

@article{arxiv.2106.14588,
  title  = {The Convergence Rate of SGD's Final Iterate: Analysis on Dimension Dependence},
  author = {Daogao Liu and Zhou Lu},
  journal= {arXiv preprint arXiv:2106.14588},
  year   = {2021}
}