中文

具有任意通信压缩的去中心化深度学习

机器学习 2020-11-12 v3 分布式、并行与集群计算 数据结构与算法 最优化与控制 机器学习

摘要

深度学习的去中心化训练是实现网络数据隐私与设备端学习,以及向大型计算集群高效扩展的关键要素。鉴于当前方法受限于网络带宽,我们提出在去中心化训练中使用通信压缩。我们证明 Choco-SGD——此前仅在强凸目标下被提出并分析——在任意高压缩比下对一般非凸函数以 O(1/nT)O\bigl(1/\sqrt{nT}\bigr) 的速率收敛,其中 TT 表示迭代次数,nn 表示工作节点数。该算法在工作节点数上实现线性加速,并支持比先前最先进方法更高的压缩比。我们在两种关键场景中展示了算法的实际性能:深度学习的训练 (i) 在由社交网络连接的分布式用户设备上,以及 (ii) 在数据中心内(在时间上优于 all-reduce)。

关键词

引用

@article{arxiv.1907.09356,
  title  = {Decentralized Deep Learning with Arbitrary Communication Compression},
  author = {Anastasia Koloskova and Tao Lin and Sebastian U. Stich and Martin Jaggi},
  journal= {arXiv preprint arXiv:1907.09356},
  year   = {2020}
}