中文

通过梯度平均策略能否将随机梯度方法的收敛速率加速至 $\mathcal{O}(1/k^2)$?

最优化与控制 2020-02-26 v1 机器学习 数值分析 数值分析

摘要

本文中我们考量是否可能应用梯度平均策略,在不增加任何存储的情况下改进次线性收敛速率。我们的分析揭示,肯定的答案需要恰当的均值策略以及满足方差主导条件的迭代。作为一个有趣的事实,我们表明,若我们所定义的迭代方差在随机梯度迭代中始终哪怕仅略微占优,则所提出的梯度平均策略能以概率将强凸且具 Lipschitz 梯度的目标函数的收敛速率由 O(1/k)\mathcal{O}(1/k) 提升至 O(1/k2)\mathcal{O}(1/k^2)。该结论提示我们应怎样控制随机梯度迭代以改善收敛速率。

关键词

引用

@article{arxiv.2002.10769,
  title  = {Can speed up the convergence rate of stochastic gradient methods to $\mathcal{O}(1/k^2)$ by a gradient averaging strategy?},
  author = {Xin Xu and Xiaopeng Luo},
  journal= {arXiv preprint arXiv:2002.10769},
  year   = {2020}
}

备注

20 pages, 1 figure