中文

光滑强凸函数的随机逼近:超越 $O(1/T)$ 收敛速率

机器学习 2019-01-29 v1 机器学习

摘要

随机逼近(SA)是随机凸优化的经典方法。以往研究表明,引入光滑性或强凸性条件均可改善 SA 的收敛速率。本文同时利用光滑性与强凸性来提升收敛速率。设 λ\lambda 为强凸模数,κ\kappa 为条件数,FF_* 为最小风险,α>1\alpha>1 为某小常数。首先,我们证明在期望意义下,当 T=Ω(κα)T = \Omega(\kappa^\alpha) 时,可达到 O(1/[λTα]+κF/T)O(1/[\lambda T^\alpha] + \kappa F_*/T) 的风险界。因此,当 FF_* 较小时,收敛速率可能快于 O(1/[λT])O(1/[\lambda T]),并在理想情况下逼近 O(1/[λTα])O(1/[\lambda T^\alpha])。其次,为进一步利用小风险带来的好处,我们证明在期望意义下可达到 O(1/2T/κ+F)O(1/2^{T/\kappa}+F_*) 的风险界。因此,超额风险呈指数下降直至达到 O(F)O(F_*),且若 F=0F_*=0,则获得全局线性收敛。最后,我们强调我们的证明是构造性的,且每个风险界都配有达到该界的高效随机算法。

关键词

引用

@article{arxiv.1901.09344,
  title  = {Stochastic Approximation of Smooth and Strongly Convex Functions: Beyond the $O(1/T)$ Convergence Rate},
  author = {Lijun Zhang and Zhi-Hua Zhou},
  journal= {arXiv preprint arXiv:1901.09344},
  year   = {2019}
}