Aergia:在联邦学习系统中利用异构性
机器学习
2026-03-19 v2 分布式、并行与集群计算
摘要
联邦学习(FL)是一种流行的分布式深度学习方法,可防止将大量数据集中到中央服务器。FL依赖客户端使用其本地数据集更新全局模型。经典的FL算法使用中央聚合器,在每一训练轮中等待所有客户端发送其模型更新后再进行聚合。在实际部署中,客户端可能具有不同的计算能力和网络条件,这可能导致慢速客户端成为性能瓶颈。先前工作建议为每轮学习设置截止时间,使聚合器忽略慢速客户端的迟发更新,或使客户端在截止时间前发送部分训练的模型。为加速训练过程,我们提出Aergia这一新方法,其中慢速客户端(i)冻结其模型中计算最密集训练的部分;(ii)训练未冻结部分的模型;(iii)将冻结部分的训练卸载给更快的客户端,该客户端使用自身数据集训练之。卸载决策由聚合器根据客户端报告的训练速度及其数据集间的相似性进行编排,后者借助可信执行环境私下评估。我们通过大量实验表明,在异构环境下,与FedAvg和TiFL相比,Aergia保持高准确率并将训练时间显著减少达27%和53%。
引用
@article{arxiv.2210.06154,
title = {Aergia: Leveraging Heterogeneity in Federated Learning Systems},
author = {Bart Cox and Lydia Y. Chen and Jérémie Decouchant},
journal= {arXiv preprint arXiv:2210.06154},
year = {2026}
}
备注
This paper is accepted at the 23rd ACM/IFIP International Middleware Conference (Middleware '22). Updated version has minor textual improvements