中文

基于梯度提升未训练神经网络的低通信开销分布式学习

机器学习 2020-11-11 v1 分布式、并行与集群计算

摘要

对于高维数据,分布式 GBDT 存在巨大的通信开销,因为 GBDT 的通信量与特征数量相关。为克服该问题,我们提出一种新颖的梯度提升算法——梯度提升未训练神经网络(Gradient Boosting Untrained Neural Network, GBUN)。GBUN 集成随机生成的未训练神经网络,该网络将数据样本软分配到多个神经元输出,从而大幅降低分布式学习的通信开销。为避免为高维数据创建庞大的神经网络,我们扩展 Simhash 算法以模拟神经网络的前向计算。我们在多个公开数据集上的实验表明,GBUN 在预测精度上与常规 GBDT 相当,而在分布式学习的扩展性上远优于后者。与常规 GBDT 变体相比,GBUN 在 64 台机器的集群上加速训练过程达 13 倍,在 100KB/s 网络带宽的集群上达 4614 倍。因此,GBUN 不仅是一种高效的分布式学习算法,而且在联邦学习方面具有巨大潜力。

关键词

引用

@article{arxiv.2011.05022,
  title  = {Distributed Learning with Low Communication Cost via Gradient Boosting Untrained Neural Network},
  author = {Xiatian Zhang and Xunshi He and Nan Wang and Rong Chen},
  journal= {arXiv preprint arXiv:2011.05022},
  year   = {2020}
}