中文

PrivImage:基于语义感知预训练扩散模型的差分隐私合成图像生成

计算机视觉与模式识别 2024-10-10 v4 密码学与安全 机器学习

摘要

差分隐私(DP)图像数据合成利用 DP 技术生成合成数据以替代敏感数据,使组织能够在不担忧隐私的情况下共享和利用合成图像。先前的方法结合生成模型的高级技术在公共数据集上预训练以产生优异的 DP 图像数据,但存在训练不稳定和巨大计算资源需求的问题。本文提出一种新颖的 DP 图像合成方法,称为 PRIVIMAGE,其精心选择预训练数据,促进高保真度和高实用性 DP 数据集的高效创建。PRIVIMAGE 首先使用公共数据集建立语义查询函数。然后,该函数辅助查询敏感数据集的语义分布,便于从公共数据集中选择具有相似语义的数据进行预训练。最后,我们使用所选数据预训练图像生成模型,然后使用差分隐私随机梯度下降(DP-SGD)在敏感数据集上微调该模型。PRIVIMAGE 使我们能够训练轻量化参数化的生成模型,减少 DP-SGD 训练期间梯度中的噪声并增强训练稳定性。大量实验表明,与最先进方法相比,PRIVIMAGE 仅使用 1% 的公共数据集进行预训练且生成模型参数占其 7.6%,却实现了更优的合成性能并节省更多计算资源。平均而言,PRIVIMAGE 比最先进方法的 FID 低 30.1%,分类准确率高 12.6%。复现包和数据集可在线访问。

关键词

引用

@article{arxiv.2311.12850,
  title  = {PrivImage: Differentially Private Synthetic Image Generation using Diffusion Models with Semantic-Aware Pretraining},
  author = {Kecen Li and Chen Gong and Zhixiang Li and Yuzhong Zhao and Xinwen Hou and Tianhao Wang},
  journal= {arXiv preprint arXiv:2311.12850},
  year   = {2024}
}

备注

Accepted at USENIX Security 2024. The first two authors contributed equally. We communicated with the author of DPSDA and have added an explanation for why the FID scores in the DPSDA table are lower than those reported in the original paper