面向大规模不可靠设备的鲁棒性联邦学习框架
机器学习
2024-12-31 v1 分布式、并行与集群计算
摘要
在联邦学习 (FL) 系统中,许多设备(如智能手机)在训练期间可能不可靠(例如,频繁断开 WiFi),导致现有 FL 框架假设环境可靠,排除不可靠设备进行训练,引发模型性能不佳和资源浪费。本文提出 FLUDE 以有效应对不可靠环境。首先,FLUDE 基于设备历史行为概率分布(例如完成训练的成功 likelihood)评估设备可靠性。基于此评估,FLUDE 自适应选择高可靠性设备进行训练。为减少训练阶段的资源浪费,FLUDE 在每个设备上维护模型缓存,以保存最新训练状态,用于在不可靠设备本地训练中断时后续使用。此外,FLUDE 提出一种滞后感知策略,仔细分配全局模型给子集设备,从而显著减少资源浪费 while maintaining model performance。我们在两个物理平台上实现了 FLUDE,包含 120 部智能手机和 NVIDIA Jetson 设备。大量实验结果表明,FLUDE 在不可靠环境下能有效提升模型性能和资源效率。
引用
@article{arxiv.2412.19991,
title = {A Robust Federated Learning Framework for Undependable Devices at Scale},
author = {Shilong Wang and Jianchun Liu and Hongli Xu and Chunming Qiao and Huarong Deng and Qiuye Zheng and Jiantao Gong},
journal= {arXiv preprint arXiv:2412.19991},
year = {2024}
}