中文

使用上下文感知 GAN 的差分隐私合成数据生成

机器学习 2025-12-10 v1 人工智能 密码学与安全

摘要

大数据在各行业的广泛使用引发了重大的隐私问题,尤其是在敏感信息被共享或分析时。GDPR 和 HIPAA 等法规对数据处理施加了严格的控制,使得在洞察需求与隐私要求之间取得平衡变得困难。合成数据通过创建反映真实模式但不暴露敏感信息的人工数据集,提供了一种有前景的解决方案。然而,传统的合成数据方法往往无法捕捉连接数据不同元素的复杂隐式规则,而这些规则在医疗等领域至关重要。它们可能再现显式模式,但忽略了未直接陈述却对真实性和效用至关重要的领域特定约束。例如,限制特定疾病使用某些药物或防止有害药物相互作用的处方指南可能不会显式地出现在原始数据中。在没有这些隐式规则的情况下生成的合成数据可能导致医学上不适当或不真实的档案。为了弥补这一差距,我们提出了 ContextGAN,一种上下文感知差分隐私生成对抗网络,通过约束矩阵整合领域特定规则,该矩阵编码了显式和隐式知识。约束感知的判别器根据这些规则评估合成数据,以确保遵守领域约束,同时差分隐私保护原始数据中的敏感细节。我们在医疗、安全和金融领域验证了 ContextGAN,表明它能产生尊重领域规则并保护隐私的高质量合成数据。我们的结果表明,ContextGAN 通过强制执行领域约束提高了真实性和效用,使其适用于在严格隐私保证下需要同时遵守显式模式和隐式规则的应用。

关键词

引用

@article{arxiv.2512.08869,
  title  = {Differentially Private Synthetic Data Generation Using Context-Aware GANs},
  author = {Anantaa Kotal and Anupam Joshi},
  journal= {arXiv preprint arXiv:2512.08869},
  year   = {2025}
}