中文

非凸 SGD 中基于动量的方差缩减

机器学习 2020-04-23 v3 最优化与控制 机器学习

摘要

近年来,方差缩减已成为随机梯度下降在非凸问题中的强劲竞争者,提供了首批在寻找一阶临界点方面优于随机梯度下降收敛速率的算法。然而,方差缩减技术通常需要精心调节的学习率,并愿意使用过大的“大批量(mega-batches)”以取得其改进结果。我们提出一种新算法 STORM,它不需要任何批量并采用自适应学习率,从而更易于实现且超参数调节更少。我们去除批量的技术利用一种动量变体在非凸优化中实现方差缩减。在光滑损失 FF 上,STORM 在 TT 次迭代内找到一个点 x\boldsymbol{x},满足 E[F(x)]O(1/T+σ1/3/T1/3)\mathbb{E}[\|\nabla F(\boldsymbol{x})\|]\le O(1/\sqrt{T}+\sigma^{1/3}/T^{1/3}),其中梯度方差为 σ2\sigma^2,该速率与最优速率匹配且无需知道 σ\sigma

关键词

引用

@article{arxiv.1905.10018,
  title  = {Momentum-Based Variance Reduction in Non-Convex SGD},
  author = {Ashok Cutkosky and Francesco Orabona},
  journal= {arXiv preprint arXiv:1905.10018},
  year   = {2020}
}

备注

Added Ack