中文

随机凸优化的经验风险最小化:$O(1/n)$ 与 $O(1/n^2)$ 型风险界

机器学习 2017-02-08 v1

摘要

尽管监督学习的经验风险最小化(ERM)已有丰富的理论,但对其相关问题——随机凸优化(SCO)的ERM的理论理解仍然有限。本工作中,我们利用光滑性和强凸性条件来改进风险界,从而拓展了SCO的ERM领域。首先,当随机函数非负、凸且光滑,且期望函数Lipschitz连续时,我们建立了 O~(d/n+F/n)\widetilde{O}(d/n + \sqrt{F_*/n}) 风险界,其中 dd 为问题维度,nn 为样本数,FF_* 为最小风险。因此,当 FF_* 较小时,我们得到 O~(d/n)\widetilde{O}(d/n) 风险界,这类似于监督学习ERM的 O~(1/n)\widetilde{O}(1/n) 乐观速率。其次,若目标函数还满足 λ\lambda-强凸,我们证明了 O~(d/n+κF/n)\widetilde{O}(d/n + \kappa F_*/n ) 风险界,其中 κ\kappa 为条件数,并在 n=Ω~(κd)n=\widetilde{\Omega}(\kappa d) 时将其改进为 O(1/[λn2]+κF/n)O(1/[\lambda n^2] + \kappa F_*/n)。结果,在 nn 大且 FF_* 小的条件下,我们得到 O(κ/n2)O(\kappa/n^2) 风险界,据我们所知,这是ERM首个 O(1/n2)O(1/n^2) 型风险界。第三,我们强调上述结果建立在一个统一框架下,该框架允许我们在更弱条件下(例如随机函数无凸性、期望函数非Lipschitz连续)推导新的风险界。最后,我们证明对于监督学习要达到 O(1/[λn2]+κF/n)O(1/[\lambda n^2] + \kappa F_*/n) 风险界,对 nnΩ~(κd)\widetilde{\Omega}(\kappa d) 要求可替换为 Ω(κ2)\Omega(\kappa^2),这与维度无关。

关键词

引用

@article{arxiv.1702.02030,
  title  = {Empirical Risk Minimization for Stochastic Convex Optimization: $O(1/n)$- and $O(1/n^2)$-type of Risk Bounds},
  author = {Lijun Zhang and Tianbao Yang and Rong Jin},
  journal= {arXiv preprint arXiv:1702.02030},
  year   = {2017}
}