中文

PAGE:一种用于非凸优化的简单且最优的概率梯度估计器

机器学习 2021-06-15 v3 人工智能 数据结构与算法 最优化与控制 机器学习

摘要

在本文中,我们提出一种新颖的随机梯度估计器——概率梯度估计器(ProbAbilistic Gradient Estimator,PAGE)——用于非凸优化。PAGE 易于实现,因为它通过对原始 SGD 的小幅调整设计而成:在每次迭代中,PAGE 以概率 ptp_t 使用原始小批量 SGD 更新,或以概率 1pt1-p_t 以低得多的计算代价复用先前的梯度并做小幅调整。我们给出了最优 ptp_t 选择的简单公式。此外,我们证明了非凸有限和问题的首个紧下界 Ω(n+nϵ2)\Omega(n+\frac{\sqrt{n}}{\epsilon^2}),这也导出了非凸在线问题的紧下界 Ω(b+bϵ2)\Omega(b+\frac{\sqrt{b}}{\epsilon^2}),其中 b:=min{σ2ϵ2,n}b:= \min\{\frac{\sigma^2}{\epsilon^2}, n\}。接着,我们证明 PAGE 取得了最优收敛结果 O(n+nϵ2)O(n+\frac{\sqrt{n}}{\epsilon^2})(有限和)与 O(b+bϵ2)O(b+\frac{\sqrt{b}}{\epsilon^2})(在线),分别与我们在非凸有限和与在线问题上的下界相匹配。此外,我们还证明对于满足 Polyak-Łojasiewicz(PL)条件的非凸函数,PAGE 可自动切换到更快的线性收敛速率 O(log1ϵ)O(\cdot\log \frac{1}{\epsilon})。最后,我们在 PyTorch 中对真实数据集进行了若干深度学习实验(如 LeNet、VGG、ResNet),表明 PAGE 不仅在训练中比 SGD 收敛快得多,而且取得了更高的测试准确率,验证了最优理论结果并确认了 PAGE 的实际优越性。

关键词

引用

@article{arxiv.2008.10898,
  title  = {PAGE: A Simple and Optimal Probabilistic Gradient Estimator for Nonconvex Optimization},
  author = {Zhize Li and Hongyan Bao and Xiangliang Zhang and Peter Richtárik},
  journal= {arXiv preprint arXiv:2008.10898},
  year   = {2021}
}

备注

25 pages; accepted by ICML 2021 (long talk)