中文

一致无锁并行随机梯度下降以实现快速稳定收敛

分布式、并行与集群计算 2021-02-19 v1 数据结构与算法

摘要

随机梯度下降 (SGD) 是机器学习 (ML) 算法的基本要素。异步并行共享内存 SGD (AsyncSGD),包括无同步算法(如 HOGWILD!),因相较同步并行降低开销而在某些场景下受到关注。尽管它们引发陈旧性与不一致性,已展示出对满足光滑、强凸目标及梯度稀疏问题的加速。近期工作在不依赖这些强假设(尤其深度学习 (DL))的问题上理解并行 SGD 潜力方面迈出重要步伐。然而,当前文献在理解 AsyncSGD 算法何时实践中可用、特别是同步与一致性机制的作用方面存在空白。我们聚焦于保持一致性的非阻塞同步在 SGD 收敛及超参数调优敏感性中的影响。我们提出 Leashed-SGD,一种可扩展的保持一致性的 AsyncSGD 算法框架,采用无锁同步,有效平衡吞吐量与延迟。我们从解析上论证算法动态、内存消耗、线程随时间的进展及预期争用。我们提供全面实证评估,验证解析论断,基准测试所提 Leashed-SGD 框架,并与训练多层感知机 (MLP) 和卷积神经网络 (CNN) 的基线比较。我们观察到争用、陈旧性与一致性的关键影响,并展示 Leashed-SGD 相较标准基于锁的 AsyncSGD 算法与 HOGWILD! 在稳定性及收敛挂钟时间上提供显著改进(从 20-80% 至多达 4 倍提升),同时降低整体内存占用。

关键词

引用

@article{arxiv.2102.09032,
  title  = {Consistent Lock-free Parallel Stochastic Gradient Descent for Fast and Stable Convergence},
  author = {Karl Bäckström and Ivan Walulya and Marina Papatriantafilou and Philippas Tsigas},
  journal= {arXiv preprint arXiv:2102.09032},
  year   = {2021}
}

备注

13 pages, 10 figures. Accepted in the 35th IEEE International Parallel & Distributed Processing Symposium