BIPPO:面向能效联邦学习服务的预算感知独立 PPO
机器学习
2025-11-12 v1 分布式、并行与集群计算
多智能体系统
摘要
联邦学习(Federated Learning, FL)是大规模物联网(IoT)系统中一种有前景的机器学习解决方案,可保证负载分配和隐私。然而,FL 原生并未考虑基础设施效率,这对于在资源受限环境中运行的系统而言是一个关键问题。几种基于强化学习(Reinforcement Learning, RL)的解决方案为 FL 提供了改进的客户端选择;然而,它们没有考虑基础设施挑战,例如资源限制和设备流失。此外,RL 方法的训练通常未针对实际应用而设计,因为这些方法通常未考虑泛化能力且未针对能效进行优化。为了填补这一空白,我们提出了 BIPPO(Budget-aware Independent Proximal Policy Optimization,预算感知独立近端策略优化),这是一种能效高且性能提升的多智能体 RL 解决方案。我们在高度预算受限的设置下运行的两个图像分类任务上评估了 BIPPO,其中 FL 客户端在非独立同分布(non-IID)数据上进行训练,这对原始 FL 而言是一个具有挑战性的环境。BIPPO 改进的采样器使其相较于非 RL 机制、传统 PPO 和 IPPO 能够提高平均准确率。此外,BIPPO 仅消耗预算中可忽略不计的比例,且即使客户端数量增加,该比例也保持一致。总体而言,BIPPO 为 IoT-FL 中的客户端选择提供了一种高性能、稳定、可扩展且可持续的解决方案。
引用
@article{arxiv.2511.08142,
title = {BIPPO: Budget-Aware Independent PPO for Energy-Efficient Federated Learning Services},
author = {Anna Lackinger and Andrea Morichetta and Pantelis A. Frangoudis and Schahram Dustdar},
journal= {arXiv preprint arXiv:2511.08142},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication