中文

并行化最小二乘回归的随机梯度下降:小批量、平均与模型误设

机器学习 2018-08-01 v4 数据结构与算法 机器学习

摘要

本工作刻画了与随机梯度下降(SGD)结合使用的平均方案的优势。具体而言,本工作提供了对以下内容的精确分析:(1) 小批量,一种对随机梯度的多个样本进行平均以减少随机梯度估计方差并用于并行化 SGD 的方法,以及 (2) 尾部平均,一种对 SGD 最后几次迭代进行平均以减少 SGD 最终迭代方差的方法。本工作给出了这些方案在最小二乘回归随机逼近问题中的非渐近超额风险界。此外,本工作确立了小批量 SGD 相比批量大小为 1 的 SGD 产生可证明的近线性并行加速的精确问题依赖程度。这有助于理解 SGD 方法最终迭代的学习率与批量大小之间的权衡。然后,这些结果被用于提供一种高度可并行化的 SGD 方法,该方法以与批量梯度下降几乎相同的串行更新次数获得了极小化极大风险,显著改进了现有的 SGD 方法。随后提供了对通信高效的并行化方案(如模型平均/参数混合方法)的非渐近分析。最后,本工作阐明了 SGD 在处理(不可实现的)最小二乘回归问题中的不可知噪声时行为的一些根本差异。具体而言,本工作表明,确保不可知情况下极小化极大风险的步长必须是噪声属性的函数。本文建立在由 Defossez 和 Bach (2015) 引入的分析 SGD 方法的算子视角之上,随后开发了一种新的分析来界定这些算子以刻画超额风险。这些技术在分析随机逼近的计算方面具有更广泛的意义。

关键词

引用

@article{arxiv.1610.03774,
  title  = {Parallelizing Stochastic Gradient Descent for Least Squares Regression: mini-batching, averaging, and model misspecification},
  author = {Prateek Jain and Sham M. Kakade and Rahul Kidambi and Praneeth Netrapalli and Aaron Sidford},
  journal= {arXiv preprint arXiv:1610.03774},
  year   = {2018}
}

备注

39 pages. Published in the Journal of Machine Learning Research (JMLR)