中文

基于API的差分隐私合成数据:使用模拟器而非基础模型

机器学习 2025-05-21 v3 密码学与安全 计算机视觉与模式识别 机器学习

摘要

差分隐私合成数据在保持强隐私保证的同时与原始私有数据高度相似,已成为释放私有数据价值的关键工具。最近,Private Evolution(PE)作为一种生成差分隐私合成数据的方法备受关注。与其他基于训练的方法不同,PE仅需访问来自基础模型的推理API,即可利用最先进(SoTA)模型的强大能力。然而,针对特定私有数据领域的合适基础模型并非总是可用。在本文中,我们发现PE框架足够通用,可容纳除基础模型之外的API。特别是,我们演示了许多不依赖神经网络的顶尖数据合成器——例如计算机图学基础的图像生成器——可有效整合到PE中。我们将这种方法称为Sim-PE。我们在图像合成领域探索了这一方法。 Sim-PE跨越四种多样化的模拟器表现良好,使PE在下游分类准确率提升最高可达3倍,FID降低最高可达80%,且效率更高。我们还表明,模拟器和基础模型可轻松在PE中协同使用,以实现进一步的改进。代码已开源于Private Evolution Python库:https://github.com/microsoft/DPSDA。

关键词

引用

@article{arxiv.2502.05505,
  title  = {Differentially Private Synthetic Data via APIs 3: Using Simulators Instead of Foundation Model},
  author = {Zinan Lin and Tadas Baltrusaitis and Wenyu Wang and Sergey Yekhanin},
  journal= {arXiv preprint arXiv:2502.05505},
  year   = {2025}
}

备注

Published in: (1) ICLR 2025 Workshop on Data Problems, (2) ICLR 2025 Workshop on Synthetic Data