中文

混合随机-确定性小批量近端梯度:少于单轮遍历的近最优泛化优化

机器学习 2020-09-22 v1 数值分析 数值分析 最优化与控制 机器学习

摘要

随机方差缩减梯度(SVRG)算法已被证明在求解大规模学习问题时表现良好。尽管取得了显著成功,SVRG类算法的随机梯度复杂度通常随数据规模线性增长,因此对于海量数据而言仍可能代价高昂。为弥补这一不足,我们针对强凸问题提出了一种混合随机-确定性小批量近端梯度(HSDMPG)算法,该算法具有可证明的、与数据规模无关的更优复杂度保证。更确切地说,对于由 nn 个分量组成的二次损失 F(θ)F(\theta),我们证明 HSDMPG 可在 O(κ1.5ϵ0.75log1.5(1ϵ)+1ϵ(κnlog1.5(1ϵ)+nlog(1ϵ)))\mathcal{O}\Big(\frac{\kappa^{1.5}\epsilon^{0.75}\log^{1.5}(\frac{1}{\epsilon})+1}{\epsilon}\wedge\Big(\kappa \sqrt{n}\log^{1.5}\big(\frac{1}{\epsilon}\big)+n\log\big(\frac{1}{\epsilon}\big)\Big)\Big) 次随机梯度评估内达到 ϵ\epsilon-优化误差 E[F(θ)F(θ)]ϵ\mathbb{E}[F(\theta)-F(\theta^*)]\leq\epsilon,其中 κ\kappa 为条件数。对于一般的强凸损失函数,我们证明了几乎相同的复杂度界,尽管代价是对数因子略有增大。对于大规模学习问题,我们的复杂度界优于先前最先进的 SVRG 算法(无论是否依赖数据规模)。特别地,在 ϵ=O(1/n)\epsilon=\mathcal{O}\big(1/\sqrt{n}\big) 的情形下(该量级对应于学习模型的内在超额误差界,因而足以保证泛化),HSDMPG 对二次和一般损失函数的随机梯度复杂度界分别为 O(n0.875log1.5(n))\mathcal{O} (n^{0.875}\log^{1.5}(n))O(n0.875log2.25(n))\mathcal{O} (n^{0.875}\log^{2.25}(n)),据我们所知,这首次实现了少于单轮数据遍历的最优泛化。大量数值结果展示了我们的算法相对于先前算法的计算优势。

关键词

引用

@article{arxiv.2009.09835,
  title  = {Hybrid Stochastic-Deterministic Minibatch Proximal Gradient: Less-Than-Single-Pass Optimization with Nearly Optimal Generalization},
  author = {Pan Zhou and Xiaotong Yuan},
  journal= {arXiv preprint arXiv:2009.09835},
  year   = {2020}
}