FLea:通过隐私保护特征增强解决联邦学习中的数据稀缺与标签偏斜
机器学习
2024-07-03 v2 密码学与安全
分布式、并行与集群计算
摘要
联邦学习(Federated Learning, FL)通过利用分布在众多边缘设备上的数据来开发模型,而无需将本地数据传输至中央服务器。然而,现有的 FL 方法在处理各设备上稀缺且标签偏斜的数据时仍面临挑战,导致本地模型过拟合与漂移,进而阻碍全局模型的性能。针对这些挑战,我们提出了一个名为 FLea 的开创性框架,包含以下关键组件:i) 一个全局特征缓冲区,存储来自多个客户端共享的激活-目标对以支持本地训练。该设计缓解了由某些类别缺失引起的本地模型漂移;ii) 一种基于本地和全局激活混合的特征增强方法,用于本地训练。该策略扩充了训练样本,从而降低了本地过拟合的风险;iii) 一种混淆方法,用于最小化中间激活与源数据之间的相关性,增强了共享特征的隐私性。为了验证 FLea 的优越性,我们使用多种数据模态进行了广泛的实验,模拟了不同级别的本地数据稀缺和标签偏斜。结果表明,FLea 始终优于 SOTA 的 FL 方法(在实验的 18 个设置中的 13 个,提升超过 ),同时缓解了与共享特征相关的隐私漏洞。代码可在 https://github.com/XTxiatong/FLea.git 获取
引用
@article{arxiv.2312.02327,
title = {FLea: Addressing Data Scarcity and Label Skew in Federated Learning via Privacy-preserving Feature Augmentation},
author = {Tong Xia and Abhirup Ghosh and Xinchi Qiu and Cecilia Mascolo},
journal= {arXiv preprint arXiv:2312.02327},
year = {2024}
}
备注
This paper has been acceped by KDD'24