利用预训练扩散模型探索一次性半监督联邦学习
计算机视觉与模式识别
2024-06-13 v3
摘要
近来,半监督联邦学习(semi-FL)被提出以应对现实世界中常见的服务器端有标注数据、客户端无标注数据的场景。然而,现有方法面临通信成本、数据异构性以及客户端设备训练压力等若干挑战。为应对这些挑战,我们将强大的扩散模型(DM)引入semi-FL,并提出FedDISC,一种联邦扩散启发的半监督协同训练方法。具体而言,我们首先提取标注服务器数据的原型,并用这些原型预测客户端数据的伪标签。对于每个类别,我们计算聚类质心与领域特定表示,以表征其分布的语义与风格信息。添加噪声后,这些表示被发回服务器,服务器使用预训练DM生成符合客户端分布的合成数据集并在其上训练全局模型。在DM海量知识的辅助下,合成数据集具有与客户端图像可比的质量和多样性,进而使得训练的全局模型达到等同于甚至超越监督集中训练上限的性能。FedDISC在一个通信轮次内工作,不需要任何本地训练,且涉及极少量的信息上传,极大提升了其实用性。在三个大规模数据集上的大量实验表明,FedDISC有效解决了非IID客户端上的semi-FL问题,并优于所对比的SOTA方法。充分的可视化实验也表明,FedDISC生成的合成数据集展现出与原始客户端数据集可比的多样性与质量,且泄露客户端隐私敏感信息的可能性可忽略。
引用
@article{arxiv.2305.04063,
title = {Exploring One-shot Semi-supervised Federated Learning with A Pre-trained Diffusion Model},
author = {Mingzhao Yang and Shangchao Su and Bin Li and Xiangyang Xue},
journal= {arXiv preprint arXiv:2305.04063},
year = {2024}
}
备注
Accepted by AAAI-24