用于分布式优化的无偏单尺度和多尺度量化器
机器学习
2022-03-31 v2 分布式、并行与集群计算
信息论
math.IT
摘要
海量数据导致在单个工作节点上训练大规模机器学习模型效率低下。诸如Parallel-SGD等分布式机器学习方法作为解决此问题的方案受到了广泛关注。然而,由于同步梯度和参数的高网络通信成本,分布式系统的性能并不随工作节点数量线性扩展。研究者提出了量化和稀疏化等技术,通过压缩梯度来缓解这一问题。大多数压缩方案产生的压缩梯度无法直接通过诸如all-reduce等高效协议进行聚合。在本文中,我们提出了一组与all-reduce兼容的梯度压缩方案,这些方案在显著降低通信开销的同时保持了普通SGD的性能。我们展示了使用CIFAR10数据集进行的实验结果以及在此过程中得出的观察。我们的压缩方法性能优于深度学习框架当前提供的内置方法。代码见仓库:\url{https://github.com/vineeths96/Gradient-Compression}。
引用
@article{arxiv.2109.12497,
title = {Unbiased Single-scale and Multi-scale Quantizers for Distributed Optimization},
author = {S Vineeth},
journal= {arXiv preprint arXiv:2109.12497},
year = {2022}
}
备注
AAAI-22 Workshop on Information Theory for Deep Learning (IT4DL)