DNN梯度无损压缩:GenNorm能否成为答案?
机器学习
2021-11-16 v1
摘要
本文研究了深度神经网络(DNN)训练中梯度无损压缩的最优问题。梯度压缩在许多分布式DNN训练场景中都具有重要意义,包括近来流行的联邦学习(FL)场景,其中每个远程用户通过无噪声但速率受限的信道连接到参数服务器(PS)。在分布式DNN训练中,若已知底层梯度分布,可使用经典的无损压缩方法来减少通信梯度项所需的比特数。平均场分析表明梯度更新可视为独立随机变量,而拉普拉斯近似可用于论证在某些情形下梯度具有近似正态(Norm)分布。本文指出,对于一些具有实际意义的网络,梯度项可以很好地建模为具有广义正态(GenNorm)分布。我们提供了数值评估以验证GenNorm建模假设能更准确地预测DNN梯度尾部分布。此外,当将经典定长变长无损编码算法(如霍夫曼编码)应用于量化梯度更新时,该建模选择在梯度无损压缩方面带来了切实的改进。后者确实提供了一种低内存与计算复杂度的有效压缩策略,在分布式DNN训练场景中具有重大的实际意义。
引用
@article{arxiv.2111.07599,
title = {DNN gradient lossless compression: Can GenNorm be the answer?},
author = {Zhong-Jing Chen and Eduin E. Hernandez and Yu-Chih Huang and Stefano Rini},
journal= {arXiv preprint arXiv:2111.07599},
year = {2021}
}