中文

随机重排在有限轮次后优于SGD

最优化与控制 2019-10-09 v2 机器学习

摘要

随机梯度下降(SGD)理论中一个长期存在的问题是证明其与不放回版本RandomShuffle相比收敛更快。我们给出了该问题首个(据我们所知)非渐近解,表明在经过“合理”数量的轮次后,RandomShuffle确实比SGD收敛更快。具体而言,我们证明在强凸性与二阶光滑性下,RandomShuffle生成的序列以O(1/T^2 + n^3/T^3)的速率收敛到最优解,其中n为目标函数中分量的个数,T为总迭代次数。该结果表明,在经过合理数量的轮次后,RandomShuffle严格优于SGD(其收敛速率为O(1/T))。证明这种对T更好依赖关系的关键一步是在界中引入n;并且正如我们的分析所示,一般而言,若不对算法做进一步改动,n的依赖是不可避免的。我们证明对于稀疏数据,RandomShuffle具有O(1/T^2)的速率,同样严格优于SGD。此外,我们讨论了向非凸梯度主导函数以及非强凸情形的推广。

关键词

引用

@article{arxiv.1806.10077,
  title  = {Random Shuffling Beats SGD after Finite Epochs},
  author = {Jeff Z. HaoChen and Suvrit Sra},
  journal= {arXiv preprint arXiv:1806.10077},
  year   = {2019}
}