中文

通过合成数据实现隐私放大:线性回归的见解

机器学习 2025-06-06 v1 密码学与安全 机器学习

摘要

合成数据继承了用于生成其模型的差分隐私保证。此外,合成数据可能因保持生成模型保密而受益于隐私放大。虽然经验研究表明这一现象,但仍缺乏严格的理论理解。在本文中,我们通过广为人知的线性回归框架来探讨此问题。首先,我们建立了负结果,表明如果对手控制生成模型的随机种子,单个合成数据点可以泄露与释放模型本身等量的信息。相反,我们表明,当合成数据由随机输入生成时,释放有限数量的合成数据点会超出模型固有保证的隐私放大。我们认为我们的线性回归中的发现可为未来推导更一般的界限提供基础。

关键词

引用

@article{arxiv.2506.05101,
  title  = {Privacy Amplification Through Synthetic Data: Insights from Linear Regression},
  author = {Clément Pierquin and Aurélien Bellet and Marc Tommasi and Matthieu Boussard},
  journal= {arXiv preprint arXiv:2506.05101},
  year   = {2025}
}

备注

26 pages, ICML 2025