具有 O(1/n) 收敛率的非强凸光滑随机逼近
机器学习
2013-06-11 v1 最优化与控制
机器学习
摘要
我们考虑随机逼近问题,其中必须在仅知晓某些点处梯度无偏估计的情况下最小化一个凸函数,这一框架包括基于经验风险最小化的机器学习方法。我们关注不具备强凸性的问题,对于此类问题,所有已知算法实现的函数值收敛率均为 O(1/n^{1/2})。我们考虑并分析了两种算法,它们在经典监督学习问题中实现了 O(1/n) 的收敛率。对于最小二乘回归,我们证明了具有恒定步长的平均随机梯度下降法可实现所需收敛率。对于逻辑回归,这一目标通过一种简单的新型随机梯度算法实现,该算法 (a) 构建损失函数的连续局部二次近似,同时 (b) 保持与随机梯度下降法相同的运行时间复杂度。对于这些算法,我们提供了泛化误差的非渐近分析(在期望意义上,以及对于最小二乘的高概率情形),并在标准机器学习基准上进行了大量实验,表明它们通常优于现有方法。
引用
@article{arxiv.1306.2119,
title = {Non-strongly-convex smooth stochastic approximation with convergence rate O(1/n)},
author = {Francis Bach and Eric Moulines},
journal= {arXiv preprint arXiv:1306.2119},
year = {2013}
}