中文

在 Renyi 差分隐私下实现 Hilbert-Schmidt 独立性:用于公平且私有的数据生成

机器学习 2025-09-01 v1

摘要

随着 GDPR、HIPAA 等隐私法规以及 AI Act 等人工智能责任框架的兴起,伦理和负责任地使用真实数据面临日益严格的约束。合成数据生成作为一种解决风险感知数据共享和模型开发的有前景的方案,尤其适用于构成敏感领域(如医疗保健)的表格数据。为解决此setting 中的隐私和公平性问题,我们提出了 FLIP (Fair Latent Intervention under Privacy guarantees),这是一种基于变分自编码器的转换器,增强了潜在扩散,以生成异构的表格数据。不同于公平感知数据生成中典型的setting, 我们假设一种与任务无关的setting,不依赖于固定、定义的下游任务,从而提供更广泛的适用性。为确保隐私,FLIP 在训练期间采用 Renyi 差分隐私 (RDP) 约束,并通过 RDP 兼容的平衡抽样来解决公平性问题,该抽样考虑了跨多个抽样率的群组特定噪声水平。在潜在空间中,我们通过对齐受保护群组之间的神经元激活模式来促进公平性,这种对齐使用了延伸 Hilbert-Schmidt 独立准则 (HSIC) 的 Centered Kernel Alignment (CKA),这是一种相似性度量。实证结果表明,FLIP 在 Renyi 差分隐私约束下,能够为任务无关的公平性以及各种下游任务显著改善公平性。

关键词

引用

@article{arxiv.2508.21815,
  title  = {Achieving Hilbert-Schmidt Independence Under R\'enyi Differential Privacy for Fair and Private Data Generation},
  author = {Tobias Hyrup and Emmanouil Panagiotou and Arjun Roy and Arthur Zimek and Eirini Ntoutsi and Peter Schneider-Kamp},
  journal= {arXiv preprint arXiv:2508.21815},
  year   = {2025}
}