通过客户端采样实现实用的去中心化学习
分布式、并行与集群计算
2024-05-08 v2
摘要
去中心化学习(DL)利用边缘设备进行协作式模型训练,同时避免中心服务器的协调。出于隐私考虑,由于训练数据从不离开设备,DL已成为集中式学习方案的一种有吸引力的替代方案。在DL的一轮中,所有节点参与模型训练并与某些其他节点交换其模型。在大规模异构网络中执行DL会因慢节点而导致高通信成本和轮次时间延长,从而有效拉长总训练时间。此外,当前的DL算法还假设所有节点始终可用于训练和聚合,降低了DL的实用性。本文提出Plexus,一个高效、可扩展且实用的DL系统。Plexus(1)通过引入去中心化对等采样器避免全网参与,该采样器每轮选择可用节点的小子集来训练模型,并且(2)每轮聚合节点产生的训练模型。Plexus设计用于处理节点的加入和离开(扰动)。我们通过将边缘设备的计算速度、成对延迟、网络容量和可用性的真实轨迹纳入实验,对Plexus进行了广泛评估。我们在四个常见学习任务上的实验经验表明,与基线DL算法相比,Plexus将时间到精度降低了1.2-8.3倍,通信量降低了2.4-15.3倍,收敛所需的训练资源降低了6.4-370倍。
引用
@article{arxiv.2302.13837,
title = {Decentralized Learning Made Practical with Client Sampling},
author = {Martijn de Vos and Akash Dhasade and Anne-Marie Kermarrec and Erick Lavoie and Johan Pouwelse and Rishi Sharma},
journal= {arXiv preprint arXiv:2302.13837},
year = {2024}
}