通过选择性同步加速分布式机器学习训练
分布式、并行与集群计算
2024-01-30 v2 计算机视觉与模式识别
机器学习
摘要
在分布式训练中,深度神经网络(DNN)在多个工作节点上并发启动,并在每一步以批量同步并行(BSP)训练方式聚合其本地更新。然而,由于聚合的高通信成本,BSP 无法线性扩展。为缓解此开销,诸如联邦平均(FedAvg)和陈旧同步并行(SSP)等替代方案要么降低同步频率,要么彻底消除同步,通常以最终精度降低为代价。在本文中,我们提出 \texttt{SelSync},一种实用、低开销的 DNN 训练方法,它动态选择在每个步骤是进行还是避免通信,具体通过调用聚合操作或根据其重要性应用本地更新来实现。我们作为 \texttt{SelSync} 的一部分提出了多种优化,以在 \textit{半同步}训练背景下改善收敛性。我们的系统在收敛到与 BSP 相同或更好精度的同时,将训练时间减少了多达 14。
引用
@article{arxiv.2307.07950,
title = {Accelerating Distributed ML Training via Selective Synchronization},
author = {Sahil Tyagi and Martin Swany},
journal= {arXiv preprint arXiv:2307.07950},
year = {2024}
}