中文

基于 Stable Diffusion 的联邦学习非独立同分布数据增强

机器学习 2024-05-14 v1 人工智能 分布式、并行与集群计算

摘要

边缘设备的不断增长使 Federated Learning(FL)成为一种前沿的分布式和协作模型训练范式,能够保留客户端数据的隐私。然而,当面对各参与客户端之间非独立同分布(Non-IID)的数据分布时,FL 将面临显著的性能下降和差异收敛问题。虽然已有一些努力,如客户端漂移缓解和高级服务器端模型融合技术在一定程度上解决了这一挑战,但它们往往忽视了性能下降的根本原因——各客户端数据缺乏能准确反映全局数据分布的相同数据。在本文中,我们引入 Gen-FedSD,这是一种 novel 方法,利用最新文本到图像基础模型的强大能力,以弥补 FL 中显著的 Non-IID 性能差距。在 Gen-FedSD 中,每个客户端为每个类别标签构建文本提示,并利用即插即用的最新预训练 Stable Diffusion 模型合成高质量数据样本。生成的合成数据针对每个客户端独特的本地数据差距和分布差异进行优化,有效地使最终的增强本地数据变为 IID。通过广泛的实验,我们展示 Gen-FedSD 在 various 数据集和 Non-IID 设置下实现了最先进的性能和显著的通信成本节省。

关键词

引用

@article{arxiv.2405.07925,
  title  = {Stable Diffusion-based Data Augmentation for Federated Learning with Non-IID Data},
  author = {Mahdi Morafah and Matthias Reisser and Bill Lin and Christos Louizos},
  journal= {arXiv preprint arXiv:2405.07925},
  year   = {2024}
}

备注

International Workshop on Federated Foundation Models for the Web 2024 (FL@FM-TheWebConf'24)