中文

k-SVRG:面向大规模优化的方差缩减

最优化与控制 2018-10-17 v2 机器学习 机器学习

摘要

方差缩减随机梯度(SGD)方法的收敛速度显著快于原始 SGD 方法。然而,这些方法在大规模问题上并不十分实用,因为它们要么 i) 需要频繁遍历全部数据以重新计算梯度——在此期间无法取得任何进展(如 SVRG),要么 ii) 它们需要额外的内存,可能超过输入问题的规模(如 SAGA)。在这项工作中,我们提出了 kk-SVRG,通过充分利用\emph{可用}内存来解决这些问题,并最小化无进展的停滞阶段。我们证明了 kk-SVRG 在强凸问题上的线性收敛性以及在非凸问题上向驻点的收敛性。数值实验表明了我们方法的有效性。

关键词

引用

@article{arxiv.1805.00982,
  title  = {k-SVRG: Variance Reduction for Large Scale Optimization},
  author = {Anant Raj and Sebastian U. Stich},
  journal= {arXiv preprint arXiv:1805.00982},
  year   = {2018}
}

备注

The title of the previous version of the manuscript was "SVRG meets SAGA: k-SVRG A Tale of Limited Memory"