基于多数投票的分布式稀疏 SGD
机器学习
2020-11-13 v1 分布式、并行与集群计算
信息论
math.IT
摘要
分布式学习,尤其是分布式随机梯度下降(DSGD)的变体,被广泛用于通过利用多个工作节点的计算资源来加速训练。然而在实践中,由于工作节点与参数服务器之间需要交换大量信息,通信延迟成为瓶颈。缓解通信瓶颈最高效的策略之一是 top-K 稀疏化。但 top-K 稀疏化需要额外的通信负载来表示稀疏模式,且各工作节点稀疏模式的不匹配阻碍了高效通信协议的利用。为解决这些问题,我们引入了一种新颖的基于多数投票的稀疏通信策略,其中工作节点首先就稀疏表示的结构达成共识。该策略显著降低了通信负载,并允许在两个通信方向上使用相同的稀疏度水平。通过在 CIFAR-10 数据集上的大量仿真,我们表明有可能实现高达 x4000 的压缩而不损失测试精度。
引用
@article{arxiv.2011.06495,
title = {Distributed Sparse SGD with Majority Voting},
author = {Kerem Ozfatura and Emre Ozfatura and Deniz Gunduz},
journal= {arXiv preprint arXiv:2011.06495},
year = {2020}
}