面向分布式梯度下降的稀疏通信
计算与语言
2021-11-30 v2 分布式、并行与集群计算
机器学习
摘要
我们通过交换稀疏更新而非稠密更新,使分布式随机梯度下降更快。梯度更新呈正偏态分布,因为大多数更新接近零,因此我们将绝对价值最小的99%的更新映射为零,然后交换稀疏矩阵。该方法可与量化结合以进一步改善压缩。我们探索了不同配置并将其应用于神经机器翻译和MNIST图像分类任务。大多数配置在MNIST上有效,而不同配置在更复杂的翻译任务上降低了收敛速度。我们的实验表明,我们可以在不损害最终精度或BLEU的情况下,在MNIST上实现高达49%的加速,在NMT上实现22%的加速。
引用
@article{arxiv.1704.05021,
title = {Sparse Communication for Distributed Gradient Descent},
author = {Alham Fikri Aji and Kenneth Heafield},
journal= {arXiv preprint arXiv:1704.05021},
year = {2021}
}
备注
EMNLP 2017