生成内容赋能的联邦学习
机器学习
2023-12-12 v1 计算机视觉与模式识别
摘要
联邦学习(FL)能够以保护隐私的方式利用分布式私有数据进行模型训练。然而,数据异构性显著限制了当前 FL 方法的性能。在本文中,我们提出了一种名为 FedGC 的新颖 FL 框架,旨在通过用生成内容使私有数据多样化来缓解数据异构性问题。FedGC 是一个易于实现的框架,因为它仅引入了一个一次性数据生成步骤。在数据生成方面,我们总结了三个关键且值得探索的方面(预算分配、提示设计和生成引导),并为每个方面提出了三种候选解决方案。具体而言,为了在生成引导的数据多样性和保真度之间取得更好的权衡,我们提出在提示和真实数据的引导下同时生成数据。然后将生成的数据与私有数据合并,以促进本地模型训练。此类生成数据增加了私有数据的多样性,防止每个客户端拟合潜在有偏的私有数据,从而缓解数据异构性问题。我们对 FedGC 进行了系统的实证研究,涵盖了多样的基线、数据集、场景和模态。有趣的发现包括:(1)即使在生成数据和私有数据之间存在显著差异时,FedGC 也能持续且显著地提升 FL 方法的性能;(2)FedGC 同时实现了更好的性能和隐私保护。我们希望这项工作能启发未来的研究进一步探索利用生成内容增强 FL 的潜力。
引用
@article{arxiv.2312.05807,
title = {Federated Learning Empowered by Generative Content},
author = {Rui Ye and Xinyu Zhu and Jingyi Chai and Siheng Chen and Yanfeng Wang},
journal= {arXiv preprint arXiv:2312.05807},
year = {2023}
}
备注
19 pages