中文

平均随机梯度下降法对逻辑回归局部强凸性的适应性

统计理论 2014-03-18 v3 机器学习 最优化与控制 统计理论

摘要

在本文中,我们考虑诸如逻辑回归等监督学习问题,并在通常的随机逼近设定下(其中观测值仅使用一次)研究带平均的随机梯度法。我们表明,在经过 NN 次迭代后,采用与 1/R2N1/R^2 \sqrt{N} 成正比的常数步长(其中 NN 为观测值数量,RR 为观测值的最大范数),收敛速率始终为 O(1/N)O(1/\sqrt{N}) 阶,并改进为 O(R2/μN)O(R^2 / \mu N),其中 μ\mu 是全局最优处 Hessian 矩阵的最小特征值(当该特征值大于 R2/NR^2/\sqrt{N} 时)。由于 μ\mu 无需预先已知,这表明平均随机梯度法能够适应目标函数的\emph{未知局部}强凸性。我们的证明依赖于逻辑损失的广义自 concordance 性质,因此可推广至所有具有均匀有界特征的广义线性模型。

关键词

引用

@article{arxiv.1303.6149,
  title  = {Adaptivity of averaged stochastic gradient descent to local strong convexity for logistic regression},
  author = {Francis Bach},
  journal= {arXiv preprint arXiv:1303.6149},
  year   = {2014}
}