中文

VFLGAN:用于垂直划分数据发布的基于纵向联邦学习的生成对抗网络

机器学习 2024-08-12 v1 人工智能 密码学与安全

摘要

在当前的人工智能(AI)时代,数据集的规模与质量在训练高质量 AI 模型中起着至关重要的作用。然而,优质数据并非免费午餐,由于《通用数据保护条例》(GDPR)等隐私法规的限制,获取优质数据总是十分困难。一种潜在的解决方案是发布与私有数据集分布相似的合成数据集。尽管如此,在某些场景下,人们发现训练 AI 模型所需的属性属于不同参与方,且由于隐私法规,它们无法共享原始数据以进行合成数据发布。在 PETS 2023 上,Xue 等人提出了首个基于生成对抗网络的垂直划分数据发布模型 VertiGAN。然而,经过深入调查,我们发现 VertiGAN 在保持不同参与方属性之间的相关性方面效果欠佳。本文提出了一种基于纵向联邦学习的生成对抗网络 VFLGAN,用于垂直划分数据发布,以解决上述问题。我们的实验结果表明,与 VertiGAN 相比,VFLGAN 显著提高了合成数据的质量。以 MNIST 数据集为例,就 Fréchet 距离而言,VFLGAN 生成的合成数据集质量比 VertiGAN 生成的高 3.2 倍。我们还为所提出的 VFLGAN 设计了一种更高效、更有效的高斯机制,以提供具有差分隐私保证的合成数据集。另一方面,差分隐私仅给出最坏情况下隐私保证的上界。本文还提出了一种实用的审计方案,该方案应用成员推理攻击来估计通过合成数据集造成的隐私泄漏。

关键词

引用

@article{arxiv.2404.09722,
  title  = {VFLGAN: Vertical Federated Learning-based Generative Adversarial Network for Vertically Partitioned Data Publication},
  author = {Xun Yuan and Yang Yang and Prosanta Gope and Aryan Pasikhani and Biplab Sikdar},
  journal= {arXiv preprint arXiv:2404.09722},
  year   = {2024}
}