中文

通过基础模型 API 生成差分隐私合成数据 1:图像

计算机视觉与模式识别 2025-05-20 v4 密码学与安全 机器学习

摘要

生成与原始隐私数据高度相似的差分隐私(DP)合成数据,是当前数据驱动世界中缓解隐私问题的可扩展方法。与当前为此任务训练定制模型的做法不同,我们旨在经由 API 生成 DP 合成数据(DPSDA),将基础模型视为黑盒并仅利用其推理 API。此类基于 API、无需训练的方法更易于部署,近期基于 API 的应用激增即为明证。这些方法还可借助仅能通过推理 API 访问的大型基础模型之力。然而,由于模型访问受到更严格限制且需防范来自 API 提供方的隐私泄露,这带来了更大挑战。在本文中,我们提出一种称为 Private Evolution(PE)的新框架来解决该问题,并展示其在合成图像上的初步成效。令人惊讶的是,PE 无需任何模型训练即可匹配甚至超越最先进(SOTA)方法。例如在 CIFAR10(以 ImageNet 作为公共数据)上,我们以隐私代价 {\epsilon} = 0.67 取得 FID <= 7.9,显著将先前 SOTA 从 {\epsilon} = 32 改进。我们进一步展示了将 PE 应用于 Stable Diffusion 等大型基础模型以应对少量高分辨率图像的困难私有数据集的潜力。代码与数据发布于 https://github.com/microsoft/DPSDA。

关键词

引用

@article{arxiv.2305.15560,
  title  = {Differentially Private Synthetic Data via Foundation Model APIs 1: Images},
  author = {Zinan Lin and Sivakanth Gopi and Janardhan Kulkarni and Harsha Nori and Sergey Yekhanin},
  journal= {arXiv preprint arXiv:2305.15560},
  year   = {2025}
}

备注

Published in ICLR 2024