利用分布式自动微分窥探梯度面纱之外
机器学习
2022-02-04 v3 分布式、并行与集群计算
摘要
尽管分布式机器学习开辟了许多新颖且令人兴奋的研究前沿,但模型和数据在不同机器、节点和站点间的碎片化仍导致可观的通信开销,阻碍了现实环境中的可靠训练。将梯度作为训练期间主要共享统计量的做法催生了若干直观的分布式深度学习算法;然而,大型深度神经网络(DNN)以梯度为中心的训练往往通信密集,常需稀疏性约束、压缩、量化等额外适配以削减带宽。我们引入一种创新的、通信友好的分布式DNN训练方法,其利用自动微分机制所揭示的梯度的外积结构。所暴露的梯度结构催生了一类新的分布式学习算法,其天然比全梯度共享更具通信效率。我们的方法称为分布式自动微分(dAD),建立在基于秩的压缩与梯度作为外积的内在结构相结合之上。我们证明,在应用于大规模文本和图像数据集时,dAD在现代架构(如transformers)上的训练效率优于其他最先进的分布式方法。我们断定,分布式学习的未来不必由以梯度为中心的算法主导。
引用
@article{arxiv.2102.09631,
title = {Peering Beyond the Gradient Veil with Distributed Auto Differentiation},
author = {Bradley T. Baker and Aashis Khanal and Vince D. Calhoun and Barak Pearlmutter and Sergey M. Plis},
journal= {arXiv preprint arXiv:2102.09631},
year = {2022}
}
备注
8 pages, 6 figures