将梯度稀疏化重新思考为总误差最小化
机器学习
2021-08-03 v1 分布式、并行与集群计算
最优化与控制
摘要
梯度压缩是解决大型深度神经网络(DNN)分布式训练中通信瓶颈的广泛确立的 remedy。在误差反馈框架下,Top- 稀疏化(有时 小至梯度大小的 )能够在相近的迭代次数下训练出与未压缩情形相同质量的模型。从优化视角,我们发现给定每迭代 元素预算,Top- 是通信最优的稀疏化器。我们认为,要进一步发挥梯度稀疏化的益处,尤其对 DNN 而言,有必要采用不同视角——从每迭代最优转向考虑整个训练的最优。我们指出总误差——所有迭代的压缩误差之和——囊括了整个训练过程中的稀疏化。随后,我们提出一个在整体训练通信预算下最小化总误差的通信复杂度模型。我们发现硬阈值稀疏化器(一种由常数硬阈值确定 的 Top- 稀疏化器变体)是该模型的最优稀疏化器。受此启发,我们给出了带误差反馈的硬阈值稀疏化器在凸与非凸情形下的收敛性分析。与 Top- 稀疏化器不同,我们证明硬阈值在凸情形下具有与 SGD 相同的渐近收敛与线性加速性质,且在非凸情形下对数据异构性无影响。我们在多种 DNN 与一逻辑回归模型上的多样实验表明,硬阈值稀疏化器比 Top- 更具通信效率。
引用
@article{arxiv.2108.00951,
title = {Rethinking gradient sparsification as total error minimization},
author = {Atal Narayan Sahu and Aritra Dutta and Ahmed M. Abdelmoniem and Trambak Banerjee and Marco Canini and Panos Kalnis},
journal= {arXiv preprint arXiv:2108.00951},
year = {2021}
}
备注
33 pages, 31 figures