关于用于非凸优化的$K$步平均随机梯度下降算法的收敛性质
机器学习
2019-11-05 v3 分布式、并行与集群计算
机器学习
摘要
尽管异步随机梯度下降方法(ASGD)在解决大规模机器学习问题方面很受欢迎,但其实际性能并不如理论结果所示的那般好。我们采用并分析了一种同步的K步平均随机梯度下降算法,称之为K-AVG。我们建立了K-AVG针对非凸目标的收敛结果,并解释了为何K步延迟是必要的,且能带来比传统并行随机梯度下降更好的性能,而后者是K-AVG在时的特例。我们还表明K-AVG比ASGD具有更好的可扩展性。K-AVG相对于ASGD的另一个优势是它允许更大的步长。在由个GPU组成的集群上,K-AVG比ASGD实现更快,并在\cifar数据集上实现了更好的准确率和更快的收敛。
引用
@article{arxiv.1708.01012,
title = {On the convergence properties of a $K$-step averaging stochastic gradient descent algorithm for nonconvex optimization},
author = {Fan Zhou and Guojing Cong},
journal= {arXiv preprint arXiv:1708.01012},
year = {2019}
}