差分隐私扩散模型生成有用的合成图像
机器学习
2023-02-28 v1 密码学与安全
计算机视觉与模式识别
机器学习
摘要
生成保留隐私的敏感图像数据集合成版本的能力,可以释放众多当前受数据可用性限制的机器学习应用。由于其惊人的图像生成质量,扩散模型是生成高质量合成数据的首选候选。然而,近期研究发现,默认情况下某些扩散模型的输出并不保留训练数据隐私。通过对具有超过 8000 万参数的 ImageNet 预训练扩散模型进行私有微调,我们在 CIFAR-10 和 Camelyon17 上就 FID 以及基于合成数据训练的下游分类器准确率而言取得了 SOTA 结果。我们将 CIFAR-10 上的 SOTA FID 从 26.2 降至 9.8,并将准确率从 51.0% 提升至 88.0%。在 Camelyon17 的合成数据上,我们实现了 91.1% 的下游准确率,接近真实数据训练时 96.5% 的 SOTA。我们利用生成模型创建无限量数据的能力来最大化下游预测性能,并进一步展示了如何使用合成数据进行超参数调优。我们的结果表明,采用差分隐私微调的扩散模型能够生成有用且可证明私有的合成数据,即使在预训练与微调分布之间存在显著分布偏移的应用中也是如此。
引用
@article{arxiv.2302.13861,
title = {Differentially Private Diffusion Models Generate Useful Synthetic Images},
author = {Sahra Ghalebikesabi and Leonard Berrada and Sven Gowal and Ira Ktena and Robert Stanforth and Jamie Hayes and Soham De and Samuel L. Smith and Olivia Wiles and Borja Balle},
journal= {arXiv preprint arXiv:2302.13861},
year = {2023}
}