中文

通过非阻塞小批量加速并行随机梯度下降

机器学习 2022-11-10 v2 分布式、并行与集群计算

摘要

SOTA去中心化SGD算法可通过使用Ring All-Reduce等通信集合进行同步,从而克服参数服务器处的带宽瓶颈。虽然分布式SGD中的参数更新可能异步发生,但仍存在同步屏障以确保每个学习器的本地训练轮次完成后,学习器才能进入下一轮次。在等待最慢学习器(掉队者)时的延迟在这些最先进去中心化框架的同步步骤中仍是一个问题。在本文中,我们提出(去)中心化非阻塞SGD(Non-blocking SGD),其可解决异构环境中的掉队者问题。Non-blocking SGD的主要思想是将原始批次拆分为小批量,然后基于已完成的小批量累积梯度并更新模型。该非阻塞思想可使用包括Ring All-reduce、D-PSGD和MATCHA在内的去中心化算法实现,以解决掉队者问题。此外,使用梯度累积更新模型也保证了收敛并避免梯度陈旧。我们还给出了带有随机掉队者延迟和设备计算效率/吞吐量的运行时间分析,以展示Non-blocking SGD的优势。在一系列数据集和深度学习网络上的实验验证了理论分析,并表明Non-blocking SGD加速了训练并加快了收敛。与D-PSGD和MACHA等最先进的去中心化异步算法相比,Non-blocking SGD在异构环境中达到相同训练损失所需时间最多减少2倍。

关键词

引用

@article{arxiv.2211.00889,
  title  = {Accelerating Parallel Stochastic Gradient Descent via Non-blocking Mini-batches},
  author = {Haoze He and Parijat Dube},
  journal= {arXiv preprint arXiv:2211.00889},
  year   = {2022}
}

备注

12 pages, 4 figures