中文

PowerGossip:去中心化深度学习中的实用低秩通信压缩

机器学习 2020-10-20 v2 分布式、并行与集群计算 最优化与控制 机器学习

摘要

有损梯度压缩已成为克服机器学习模型集中协调分布式训练通信瓶颈的实用工具。然而,在任意连通网络上使用压缩通信进行去中心化训练的算法更为复杂,需要额外的内存与超参数。我们引入了一种简单算法,直接使用作用于模型差异的低秩线性压缩器来压缩相邻工作节点间的模型差异。受集中式深度学习中PowerSGD算法的启发,该算法利用幂迭代步骤最大化每比特传输的信息量。我们证明了我们的方法无需额外超参数,比先前方法收敛更快,且在渐近意义上与网络和压缩均无关。这些压缩器在一系列深度学习基准测试中开箱即用,性能与最先进的调优压缩算法相当。

关键词

引用

@article{arxiv.2008.01425,
  title  = {PowerGossip: Practical Low-Rank Communication Compression in Decentralized Deep Learning},
  author = {Thijs Vogels and Sai Praneeth Karimireddy and Martin Jaggi},
  journal= {arXiv preprint arXiv:2008.01425},
  year   = {2020}
}

备注

To appear in NeurIPS 2020