中文

隐私保护的公平合成表格数据

机器学习 2025-03-06 v1 密码学与安全

摘要

共享包含有价值但私人信息的表格数据受到法律和伦理问题的限制。合成数据可以作为这一共享问题的替代方案,因为它是由机器学习算法人工生成的,并试图捕捉底层数据分布。然而,机器学习模型并非不受记忆化影响,并且可能引入偏差,因为它们依赖于训练数据。生成在保持与真实数据接近的效用性的同时保护隐私和公平性的合成数据是一项具有挑战性的任务。本研究同时解决了合成数据的隐私和公平性方面,这是其他研究未探索的领域。在本工作中,我们提出了PF-WGAN,一种基于WGAN-GP模型的隐私保护、公平合成表格数据生成器。我们通过添加隐私和公平性约束对原始WGAN-GP进行了修改,迫使它生成隐私保护的公平数据。这种方法将使发布保护个人隐私且对任何特定群体保持无偏的数据集成为可能。我们在四个不同数据集上,将结果与三种最先进的合成数据生成模型在效用性、隐私性和公平性方面进行了比较。我们发现,所提出的模型在效用性、隐私性和公平性之间呈现出更平衡的权衡。

关键词

引用

@article{arxiv.2503.02968,
  title  = {Privacy-Preserving Fair Synthetic Tabular Data},
  author = {Fatima J. Sarmin and Atiquer R. Rahman and Christopher J. Henry and Noman Mohammed},
  journal= {arXiv preprint arXiv:2503.02968},
  year   = {2025}
}