中文

拜占庭随机梯度下降

机器学习 2018-03-26 v1 分布式、并行与集群计算 数据结构与算法 最优化与控制 机器学习

摘要

本文研究对抗环境下的分布式随机优化问题,其中在每次迭代中声称计算随机梯度的 mm 台机器里,有 α\alpha 比例的机器是拜占庭式的,它们可以任意且对抗性地行动。我们的主要结果是随机梯度下降(SGD)的一个变体,该算法在 T=O~(1ε2m+α2ε2)T = \tilde{O}\big( \frac{1}{\varepsilon^2 m} + \frac{\alpha^2}{\varepsilon^2} \big) 次迭代内找到凸函数的 ε\varepsilon-近似极小值点。相比之下,传统的 mini-batch SGD 需要 T=O(1ε2m)T = O\big( \frac{1}{\varepsilon^2 m} \big) 次迭代,但无法容忍拜占庭故障。此外,我们给出了一个下界证明,表明在对数因子范围内,我们的算法在采样复杂度和时间复杂度上均是信息论最优的。

关键词

引用

@article{arxiv.1803.08917,
  title  = {Byzantine Stochastic Gradient Descent},
  author = {Dan Alistarh and Zeyuan Allen-Zhu and Jerry Li},
  journal= {arXiv preprint arXiv:1803.08917},
  year   = {2018}
}