中文

更大即更好:渐进方差缩减随机优化所享有的学习率效应

机器学习 2017-04-18 v1 人工智能 最优化与控制 机器学习

摘要

在本文中,我们提出了原始随机方差缩减梯度(SVRG)的一个简单变体,此后称之为方差缩减随机梯度下降(VR-SGD)。与SVRG及其近端变体Prox-SVRG中快照点和起点的选择不同,VR-SGD中每个轮次的两个向量分别设为上一轮次的平均值和最后迭代值。这一设置使得我们能够使用比SVRG大得多的学习率或步长,例如VR-SGD为3/(7L)而SVRG为1/(10L),并且也使我们的收敛分析更具挑战性。事实上,VR-SGD所享有的更大学习率意味着其随机梯度估计器的方差渐近地更快趋近于零。与SVRG等常见随机方法以及Prox-SVRG等近端随机方法不同,我们分别为光滑和非光滑目标函数设计了两种不同的更新规则。换言之,VR-SGD无需使用诸如二次正则化器等任何约减技术,即可直接处理非光滑和/或非强凸问题。此外,我们分析了VR-SGD针对强凸问题的收敛性质,表明VR-SGD达到线性收敛速率。我们还提供了VR-SGD在非强凸问题上的收敛保证。实验结果表明,VR-SGD的性能显著优于其对应方法SVRG和Prox-SVRG,并且也远优于已知最佳的随机方法Katyusha。

关键词

引用

@article{arxiv.1704.04966,
  title  = {Larger is Better: The Effect of Learning Rates Enjoyed by Stochastic Optimization with Progressive Variance Reduction},
  author = {Fanhua Shang},
  journal= {arXiv preprint arXiv:1704.04966},
  year   = {2017}
}

备注

36 pages, 10 figures. The simple variant of SVRG is much better than the best-known stochastic method, Katyusha