平均随机梯度下降法对逻辑回归局部强凸性的适应性
统计理论
2014-03-18 v3 机器学习
最优化与控制
统计理论
摘要
在本文中,我们考虑诸如逻辑回归等监督学习问题,并在通常的随机逼近设定下(其中观测值仅使用一次)研究带平均的随机梯度法。我们表明,在经过 次迭代后,采用与 成正比的常数步长(其中 为观测值数量, 为观测值的最大范数),收敛速率始终为 阶,并改进为 ,其中 是全局最优处 Hessian 矩阵的最小特征值(当该特征值大于 时)。由于 无需预先已知,这表明平均随机梯度法能够适应目标函数的\emph{未知局部}强凸性。我们的证明依赖于逻辑损失的广义自 concordance 性质,因此可推广至所有具有均匀有界特征的广义线性模型。
引用
@article{arxiv.1303.6149,
title = {Adaptivity of averaged stochastic gradient descent to local strong convexity for logistic regression},
author = {Francis Bach},
journal= {arXiv preprint arXiv:1303.6149},
year = {2014}
}