中文

随机重排下的随机梯度下降表现如何

机器学习 2021-06-03 v4 最优化与控制 机器学习

摘要

我们研究随机梯度下降(SGD)在光滑且强凸的有限和优化问题上的性能。与现有多数理论工作假设个体函数被有放回地采样不同,我们在此关注流行但理解甚少的一些启发式方法,这些方法涉及遍历个体函数的随机排列。该设置已在近期若干工作中被研究,但最优误差率仍不清楚。在本文中,我们给出了使用这些启发式方法(采用任意常数步长的 SGD)时期望优化误差的下界,阐明了它们的优点与缺点。特别地,我们证明在对 nn 个个体函数进行 kk 遍遍历后,若每遍之后重新打乱函数顺序,SGD 的最佳可能优化误差至少为 Ω(1/(nk)2+1/nk3)\Omega\left(1/(nk)^2+1/nk^3\right),这部分对应于近期推导出的上界。此外,若仅打乱一次函数顺序,则下界增大至 Ω(1/nk2)\Omega(1/nk^2)。由于重复重排存在严格更小的上界,这证明了单次重排与重复重排的 SGD 之间存在固有的性能差距。作为一个较次要的贡献,我们还给出了当不进行随机重排时,增量梯度方法的非渐近 Ω(1/k2)\Omega(1/k^2) 下界(与 nn 无关)。最后,我们通过证明单变量二次函数上的匹配上界,给出了我们的下界是紧的指示。

关键词

引用

@article{arxiv.1908.00045,
  title  = {How Good is SGD with Random Shuffling?},
  author = {Itay Safran and Ohad Shamir},
  journal= {arXiv preprint arXiv:1908.00045},
  year   = {2021}
}