中文

基于智能网卡提升联邦学习服务器性能

分布式、并行与集群计算 2023-12-19 v2

摘要

联邦学习是一种分布式机器学习方法,其中客户端在本地训练得到的局部权重参数由服务器聚合为全局参数。全局参数可在不将客户端拥有的隐私敏感原始数据上传至服务器的情况下进行训练。服务器上的聚合仅通过对局部权重参数求平均完成,因此是一项 I/O 密集型任务,其中网络处理相对于计算所占比例很大。随着客户端数量增加,网络处理负载进一步上升。为缓解网络处理负载,本文将以 NVIDIA BlueField-2 DPU(一种具有八个处理核心的智能网卡(Network Interface Card, NIC))来卸载联邦学习服务器。通过 DPDK(Data Plane Development Kit,数据平面开发套件)分配专用处理核心用于接收局部权重参数和发送全局参数。聚合任务利用 DPU 上可用的多核进行并行化。为进一步提升性能,还实现了一种消除计算线程间排他性访问控制的近似设计。评估结果表明,与主机 CPU 上的基线服务器相比,所提出的基于 DPDK 且采用近似方法的 DPU 联邦学习服务器将执行时间加速了 1.39 倍,且精度损失可忽略不计。

关键词

引用

@article{arxiv.2307.06561,
  title  = {Performance Improvement of Federated Learning Server using Smart NIC},
  author = {Naoki Shibahara and Michihiro Koibuchi and Hiroki Matsutani},
  journal= {arXiv preprint arXiv:2307.06561},
  year   = {2023}
}

备注

CANDAR'23 Workshops