中文

当隐私并非合成:生成式 AI 模型中的隐藏数据泄露

机器学习 2025-12-09 v1 人工智能

摘要

生成式模型越来越多地用于生产隐私保留的合成数据,以作为安全替代方案,避免共享敏感训练数据集。然而,我们展示了即使如此,合成发布的数据仍可能通过数据流形上的结构重叠泄露关于底层训练样本的信息。我们提出了一种黑盒成员推断攻击,利用这一漏洞,无需访问模型内部或真实数据。攻击者反复查询生成式模型获取大量合成样本,进行无监督聚类以识别合成分布的密集区域,然后分析与训练数据中高密度区域对应的簇中心及其邻域。这些邻域充当训练样本的代理,使攻击者能够推断成员身份或重建近似记录。我们的实验在医疗保健、金融等多个敏感领域显示,真实数据与合成数据的簇重叠导致可测量的成员泄露——即使生成器使用差分隐私或其他噪声机制进行训练。结果凸显了合成数据生成管道中尚未被充分探讨的攻击面,呼吁采用考虑分布式邻域推断而非仅样本级记忆的更强隐私保证,强调其在隐私保留数据发布中的作用。实现和评估代码已公开于 github.com/Cluster-Medoid-Leakage-Attack。

关键词

引用

@article{arxiv.2512.06062,
  title  = {When Privacy Isn't Synthetic: Hidden Data Leakage in Generative AI Models},
  author = {S. M. Mustaqim and Anantaa Kotal and Paul H. Yi},
  journal= {arXiv preprint arXiv:2512.06062},
  year   = {2025}
}