中文

FLea: 基于隐私保护特征增强解决联邦学习中的数据稀缺与标签偏斜问题

机器学习 2024-06-24 v2 分布式、并行与集群计算

摘要

联邦学习 (FL) 通过利用分布在众多边缘设备上的数据,实现模型开发,无需将本地数据传输到中心服务器。然而,现有联邦学习方法在面对边缘设备上稀缺且标签偏斜的数据时仍面临挑战,导致本地模型过拟合和漂移,从而阻碍全局模型性能。为应对这些挑战,我们提出了首个框架 FLea,包含以下关键组件:i) 存储来自多个客户端共享的激活-目标对的全局特征缓冲区,以支持本地训练。此设计缓解因缺乏某些类别而导致的本地模型漂移;ii) 基于本地和全局激活混合的特征增强方法,用于本地训练。此策略扩大训练样本数量,从而降低本地过拟合风险;iii) 一种混淆方法,以最小化中间激活与源数据之间的相关性,增强共享特征的隐私性。为验证 FLea 的优越性,我们使用广泛的数据模态进行大量实验,模拟不同的本地数据稀缺程度和标签偏斜程度。结果表明,FLea 在 18 个实验设置中 13 个情况下的性能均显著优于最先进的联邦学习方法(平均提升超过 5%),同时有效缓解了共享特征潜在的隐私漏洞。代码已公开于 https://github.com/XTxiatong/FLea.git。

关键词

引用

@article{arxiv.2406.09547,
  title  = {FLea: Addressing Data Scarcity and Label Skew in Federated Learning via Privacy-preserving Feature Augmentation},
  author = {Tong Xia and Abhirup Ghosh and Xinchi Qiu and Cecilia Mascolo},
  journal= {arXiv preprint arXiv:2406.09547},
  year   = {2024}
}

备注

This work was intended as a replacement of arXiv:2312.02327 and any subsequent updates will appear there