中文

AdaBatch:面向序列与并行随机梯度方法的高效梯度聚合规则

机器学习 2017-11-07 v1 最优化与控制 机器学习

摘要

我们研究了一种用于随机梯度(SG)方法中来自小批量(mini-batch)梯度的新聚合算子,该算子在稀疏优化问题中能显著加速。我们称此方法为 AdaBatch,与常规小批量 SGD 算法相比仅需改动几行代码。我们提供理论分析以理解这类新算法的表现,并表明其等价于对梯度进行隐式的逐坐标重缩放,类似于 Adagrad 类方法。在理论与实践中,这种新聚合能在增大批量大小的同时保持 SG 方法相同的样本效率。通过实验我们还表明,在光滑凸优化情形下,对于固定样本数,增大批量大小甚至可使我们的过程获得更优的损失值。我们随后应用这一新算法得到一种可并行的随机梯度方法,该方法为同步式,但能获得与 Hogwild! 方法相当的加速,因为收敛性不会随批量增大而恶化。同样的方法可用于使小批量在方差缩减 SG 方法(如 SVRG)中可被证明是高效的。

关键词

引用

@article{arxiv.1711.01761,
  title  = {AdaBatch: Efficient Gradient Aggregation Rules for Sequential and Parallel Stochastic Gradient Methods},
  author = {Alexandre Défossez and Francis Bach},
  journal= {arXiv preprint arXiv:1711.01761},
  year   = {2017}
}