ATOMO:基于原子稀疏化的通信高效学习
机器学习
2018-11-12 v3 分布式、并行与集群计算
机器学习
摘要
分布式模型训练因计算节点间频繁传输梯度更新而受通信开销所累。为缓解这些开销,若干研究提出使用稀疏化随机梯度。我们主张这些是可在任意可能的原子分解上运作的一般稀疏化方法的各个方面。显著例子包括元素级、奇异值和傅里叶分解。我们提出 ATOMO,一个随机梯度原子稀疏化通用框架。给定梯度、原子分解和稀疏性预算,ATOMO 给出最小化方差的原子随机无偏稀疏化。我们展示近期方法如 QSGD 和 TernGrad 是 ATOMO 的特例,且对神经网络梯度的奇异值分解而非其坐标进行稀疏化可显著加快分布式训练。
引用
@article{arxiv.1806.04090,
title = {ATOMO: Communication-efficient Learning via Atomic Sparsification},
author = {Hongyi Wang and Scott Sievert and Zachary Charles and Shengchao Liu and Stephen Wright and Dimitris Papailiopoulos},
journal= {arXiv preprint arXiv:1806.04090},
year = {2018}
}