中文

基于局部多项式回归的梯度经验风险最小化

机器学习 2020-11-06 v1 最优化与控制 统计理论 机器学习 统计理论

摘要

本文考虑利用基于梯度的迭代方法对光滑、强凸损失函数进行经验风险最小化(ERM)的问题。该领域文献的一个主要目标是通过分析梯度下降(GD)或随机梯度下降(SGD)等不同算法到ϵ\epsilon近似解的收敛速率来进行比较。例如,GD的预言复杂度为O(nlog(ϵ1))O(n\log(\epsilon^{-1})),其中nn为训练样本数。当nn很大时,这在实际中代价高昂,而SGD因其O(ϵ1)O(\epsilon^{-1})的预言复杂度更受青睐。此类标准分析仅利用了损失函数关于所优化参数的光滑性。相反,我们证明当损失函数关于数据光滑时,我们可在每次迭代中学习预言器,并在重要区间内击败GD与SGD的预言复杂度。具体而言,在每次迭代中,我们所提算法执行局部多项式回归以学习损失函数的梯度,然后估计ERM目标函数的真实梯度。我们确立算法预言复杂度量级为O~((pϵ1)d/(2η))\tilde{O}((p \epsilon^{-1})^{d/(2\eta)})(忽略次主导因子),其中ddpp分别为数据与参数空间维度,且损失函数梯度关于数据属于η\eta-Hölder类。我们的证明将非参数统计中局部多项式回归的分析拓展至多元情形以提供插值保证,并借用了非精确GD文献中的工具。与GD和SGD不同,我们方法的复杂度依赖于ddpp。然而,当dd较小且损失函数对数据呈现适度光滑性时,我们的算法在极广范围的ppϵ\epsilon下击败GD与SGD的预言复杂度。

关键词

引用

@article{arxiv.2011.02522,
  title  = {Gradient-Based Empirical Risk Minimization using Local Polynomial Regression},
  author = {Ali Jadbabaie and Anuran Makur and Devavrat Shah},
  journal= {arXiv preprint arXiv:2011.02522},
  year   = {2020}
}

备注

34 pages