中文

P4SGD:可编程交换机增强的分布式FPGA广义线性模型并行训练

分布式、并行与集群计算 2023-05-11 v1

摘要

广义线性模型(GLMs)是现实应用中广泛使用的机器学习模型族。随着数据规模增长,对这些模型进行高效分布式训练至关重要。然而,现有分布式训练系统通信成本高,且常使用大批量大小以平衡计算与通信,这对收敛产生负面影响。因此,我们主张构建一种高效的分布式GLM训练系统,力求实现线性可扩展性,同时将批量大小保持在合理较低水平。首先,我们提出P4SGD,一种分布式异构训练系统,它通过分布式FPGA间的模型并行以及FPGA内的前向-通信-反向流水线并行来高效训练GLMs。此外,我们提出一种轻量、以延迟为中心的交换机内聚合协议,由可编程交换机驱动,以最小化分布式FPGA间AllReduce操作的延迟。因此,据我们所知,P4SGD是首个通过模型并行在分布式加速器间实现近乎线性可扩展性的方案。我们在八块Xilinx U280 FPGA和一台Tofino P4交换机上实现P4SGD。实验表明,P4SGD比最先进的GPU对应系统收敛快达6.5倍。

关键词

引用

@article{arxiv.2305.05885,
  title  = {P4SGD: Programmable Switch Enhanced Model-Parallel Training on Generalized Linear Models on Distributed FPGAs},
  author = {Hongjing Huang and Yingtao Li and Jie Sun and Xueying Zhu and Jie Zhang and Liang Luo and Jialin Li and Zeke Wang},
  journal= {arXiv preprint arXiv:2305.05885},
  year   = {2023}
}