强凸函数随机梯度下降算法的 O(1/T) 收敛速率
机器学习
2013-05-13 v1 人工智能
摘要
采用与 t 成正比的加权方案,传统的随机梯度下降 (SGD) 算法对于强凸函数可实现 O(\kappa/T) 的高概率收敛速率,而非 O(\kappa ln(T)/T)。我们还证明了一种加速 SGD 算法也能达到 O(\kappa/T) 的速率。
引用
@article{arxiv.1305.2218,
title = {Stochastic gradient descent algorithms for strongly convex functions at O(1/T) convergence rates},
author = {Shenghuo Zhu},
journal= {arXiv preprint arXiv:1305.2218},
year = {2013}
}