DS-Sync:以分而洗牌同步解决分布式DNN训练中的网络瓶颈
机器学习
2022-01-14 v2 分布式、并行与集群计算
机器学习
摘要
批量同步并行(BSP)是当今生产集群中分布式DNN训练的事实标准范式。然而,由于其全局同步特性,其性能会显著受到由静态拓扑异构性或动态带宽争用引起的网络瓶颈的影响。现有方案,无论是强化BSP的系统级优化(如Ring或Hierarchical All-reduce),还是替代BSP的算法级优化(如ASP或SSP,它们放宽全局屏障),都未能完全解决问题,因为它们可能仍遭受通信低效或面临收敛不准确的危险。本文提出一种新颖的分而洗牌同步(DS-Sync),在分布式DNN训练中实现通信效率而不牺牲收敛精度。其核心在于,通过考虑网络瓶颈,DS-Sync将工作节点划分为互不重叠的组,以无瓶颈的方式独立同步,从而提高通信效率。同时,它通过在不同组间迭代洗牌工作节点来确保全局共识,从而保持收敛精度。我们从理论上证明DS-Sync在如DNN般的非凸且平滑条件下能正确收敛。我们进一步实现DS-Sync并将其集成到PyTorch中,测试床实验表明,在与现有方案保持相同精度的情况下,DS-Sync在端到端训练时间上可带来高达的提升。
引用
@article{arxiv.2007.03298,
title = {DS-Sync: Addressing Network Bottlenecks with Divide-and-Shuffle Synchronization for Distributed DNN Training},
author = {Weiyan Wang and Cengguang Zhang and Liu Yang and Kai Chen and Kun Tan},
journal= {arXiv preprint arXiv:2007.03298},
year = {2022}
}
备注
Infocom 2022