数据低语:通过虚拟客户端模拟探索联邦学习中的标签分布
机器学习
2025-05-01 v1 密码学与安全
摘要
联邦学习允许多个分散在不同地理位置的客户端在无需数据共享的情况下协同训练全局模型。然而,它容易受到推理攻击,尤其是标签推理攻击。现有研究对标签分布推理表现出对特定受害客户端设置的敏感性,通常在防御策略下表现不佳。在本研究中,我们提出一种稳定且适用于各种场景的新型标签分布推理攻击。具体而言,我们估计受害客户端数据集的大小,并为受害客户端构建几个虚拟客户端。随后,我们量化每个类别标签的虚拟客户端的时间通用性,并利用时间通用性的变化来训练推理模型,以预测受害客户端的标签分布比例。我们在多个数据集上验证了该方法,包括 MNIST、Fashion-MNIST、FER2013 和 AG-News。结果表明,我们的方法优于最新技术。此外,即使在差分隐私防御机制下,我们的攻击仍然有效,凸显了其在现实场景中的潜力。
引用
@article{arxiv.2504.21436,
title = {Whispers of Data: Unveiling Label Distributions in Federated Learning Through Virtual Client Simulation},
author = {Zhixuan Ma and Haichang Gao and Junxiang Huang and Ping Wang},
journal= {arXiv preprint arXiv:2504.21436},
year = {2025}
}