中文

相邻领袖去中心化随机梯度下降

机器学习 2024-08-21 v2

摘要

本文聚焦于去中心化深度学习优化框架。我们提出了一种名为相邻领袖去中心化梯度下降(AL-DSGD)的算法,以提高最终模型性能、加速收敛速度并降低去中心化深度学习优化器的通信开销。AL-DSGD的核心思想有两个:首先,为提高系统中最强学习者的影响力,根据其性能和在平均过程中所占的程度,对不同邻居工作者分配权重,并对当前表现最佳的邻居以及最大度邻居施加纠正力。其次,为缓解低度节点收敛速度和性能下降的问题,AL-DSGD采用动态通信图,有效地允许工作者在保持节点度数较低的同时与更多节点通信。实验结果表明,AL-DSGD加速了去中心化最新技术的收敛速度,并在通信受限的环境中显著提升了测试性能。我们还在此基础上证明了所提方案的收敛性。最后,我们向社区发布了一个高度通用且简洁的基于PyTorch的库,支持深度学习模型的分布式训练,易于实现任何分布式深度学习方法(包括(非)同步、(去)中心化)。

关键词

引用

@article{arxiv.2405.11389,
  title  = {Adjacent Leader Decentralized Stochastic Gradient Descent},
  author = {Haoze He and Jing Wang and Anna Choromanska},
  journal= {arXiv preprint arXiv:2405.11389},
  year   = {2024}
}

备注

9 pages of main paper, and 12 pages of appendix