中文

基于扩散模型的数据合成辅助联邦半监督学习

机器学习 2025-01-07 v1 人工智能 信息论 math.IT

摘要

联邦半监督学习(FSSL)主要面临两个挑战:跨客户端标注数据稀缺和数据呈非独立同分布(non-IID)情况。本文提出一种新方法,即扩散模型驱动的数据合成辅助联邦半监督学习(DDSA-FSSL),利用扩散模型(DM)生成合成数据,弥合异构局部数据分布与全局数据分布之间的差距。在DDSA-FSSL中,客户端通过采用在联邦学习中训练的分类器对 unlabeled 数据进行伪标签标记。随后,DM基于标注数据和经精确优化的伪标签数据进行协同训练,使客户端能够生成其标注数据集中缺失的类别的合成样本。此过程允许客户端生成更全面与全局分布一致的合成数据集。在多个数据集上进行的大量实验,包括不同非IID分布情况下的实验,表明DDS-FSSL有效性,例如在10%标注数据的情况下,在CIFAR-10数据集上准确率提升至52.14%,从38.46%提升。

关键词

引用

@article{arxiv.2501.02219,
  title  = {Diffusion Model-Based Data Synthesis Aided Federated Semi-Supervised Learning},
  author = {Zhongwei Wang and Tong Wu and Zhiyong Chen and Liang Qian and Yin Xu and Meixia Tao},
  journal= {arXiv preprint arXiv:2501.02219},
  year   = {2025}
}

备注

accepted by IEEE WCNC 2025