中文

强凸函数随机梯度下降算法的 O(1/T) 收敛速率

机器学习 2013-05-13 v1 人工智能

摘要

采用与 t 成正比的加权方案,传统的随机梯度下降 (SGD) 算法对于强凸函数可实现 O(\kappa/T) 的高概率收敛速率,而非 O(\kappa ln(T)/T)。我们还证明了一种加速 SGD 算法也能达到 O(\kappa/T) 的速率。

关键词

引用

@article{arxiv.1305.2218,
  title  = {Stochastic gradient descent algorithms for strongly convex functions at O(1/T) convergence rates},
  author = {Shenghuo Zhu},
  journal= {arXiv preprint arXiv:1305.2218},
  year   = {2013}
}