SSD-SSD:面向分布式深度学习训练的通信稀疏化
分布式、并行与集群计算
2021-04-12 v3
摘要
梯度和参数的密集通信与同步成本是分布式深度学习训练众所周知的瓶颈。基于同步 SGD(SSGD)获得良好收敛精度而异步 SGD(ASGD)提供更快原始训练速度的观测,我们提出多步延迟 SGD(SSD-SGD)以结合二者优点,旨在通过通信稀疏化解决通信瓶颈。SSD-SGD 在每个周期迭代中同时利用参数服务器中的全局同步更新与工人中的异步本地更新。周期性与灵活的同步使 SSD-SGD 取得良好的收敛精度与快速的训练速度。据我们所知,我们在同步质量与通信稀疏化之间达成了新的平衡,并改进了精度与训练速度之间的权衡。具体而言,SSD-SGD 的核心组件包括适当的预热阶段、步数延迟阶段,以及我们用于本地更新的全局梯度(GLU)新算法。GLU 对于本地更新操作有效补偿延迟的本地权重至关重要。此外,我们在 MXNet 框架上实现 SSD-SGD,并使用 CIFAR-10 和 ImageNet 数据集全面评估其性能。实验结果表明,在不同实验配置下 SSD-SGD 可加速分布式训练速度至多 110%,同时达到良好的收敛精度。
引用
@article{arxiv.2012.05396,
title = {SSD-SSD: Communication sparsification for distributed deep learning training},
author = {Yemao Xu and Dezun Dong and Yawei Zhao and Weixia Xu and Xiangke Liao},
journal= {arXiv preprint arXiv:2012.05396},
year = {2021}
}