中文

面向分布式梯度下降的稀疏通信

计算与语言 2021-11-30 v2 分布式、并行与集群计算 机器学习

摘要

我们通过交换稀疏更新而非稠密更新,使分布式随机梯度下降更快。梯度更新呈正偏态分布,因为大多数更新接近零,因此我们将绝对价值最小的99%的更新映射为零,然后交换稀疏矩阵。该方法可与量化结合以进一步改善压缩。我们探索了不同配置并将其应用于神经机器翻译和MNIST图像分类任务。大多数配置在MNIST上有效,而不同配置在更复杂的翻译任务上降低了收敛速度。我们的实验表明,我们可以在不损害最终精度或BLEU的情况下,在MNIST上实现高达49%的加速,在NMT上实现22%的加速。

关键词

引用

@article{arxiv.1704.05021,
  title  = {Sparse Communication for Distributed Gradient Descent},
  author = {Alham Fikri Aji and Kenneth Heafield},
  journal= {arXiv preprint arXiv:1704.05021},
  year   = {2021}
}

备注

EMNLP 2017