DP$^2$-VAE:基于差分隐私预训练的变分自编码器
机器学习
2022-11-04 v2 密码学与安全
摘要
现代机器学习系统在大规模数据集上训练时取得了巨大成功。然而,这些数据集通常包含敏感信息(如医疗记录、人脸图像),从而引发严重的隐私问题。差分隐私生成模型(DPGMs)通过生成经隐私化的敏感数据,成为规避此类隐私问题的一种解决方案。与其他差分隐私(DP)学习器类似,DPGM 的主要挑战同样在于如何在效用与隐私之间取得微妙的平衡。我们提出 DP-VAE,一种针对变分自编码器(VAE)的新型训练机制,通过对私有数据预训练提供可证明的 DP 保证并改善效用。在相同 DP 约束下,DP-VAE 最小化训练过程中的扰动噪声,从而提升效用。DP-VAE 非常灵活,易于适配许多其他 VAE 变体。在理论上,我们研究了在私有数据上预训练的影响。在实验上,我们在图像数据集上进行了大量实验,以说明在各种隐私预算和评估指标下相对基线的优越性。
引用
@article{arxiv.2208.03409,
title = {DP$^2$-VAE: Differentially Private Pre-trained Variational Autoencoders},
author = {Dihong Jiang and Guojun Zhang and Mahdi Karami and Xi Chen and Yunfeng Shao and Yaoliang Yu},
journal= {arXiv preprint arXiv:2208.03409},
year = {2022}
}
备注
The privacy analysis in the first version is incorrect