勿生成我:用 Sinkhorn 散度训练差分隐私生成模型
机器学习
2022-06-22 v2 密码学与安全
摘要
尽管在海量数据上训练的机器学习模型已在多个领域取得突破,但由于数据访问受限,其在隐私敏感领域的部署仍然有限。在私有数据上以隐私约束训练的生成模型可规避此挑战,转而提供对私有数据的间接访问。我们提出 DP-Sinkhorn,一种基于最优传输的新型生成方法,用于以差分隐私从私有数据学习数据分布。DP-Sinkhorn 以差分隐私方式最小化模型与数据之间的 Sinkhorn 散度(精确最优传输距离的计算高效近似),并采用一种新技术来控制梯度估计的偏差-方差权衡。与现有主要基于生成对抗网络训练差分隐私生成模型的方法不同,我们不依赖对抗目标,后者以难以优化著称,尤其在隐私约束所施加的噪声存在时。因此,DP-Sinkhorn 易于训练和部署。在实验上,我们在多个图像建模基准上改进了当前最优水平,并展示了差分隐私下的信息性 RGB 图像合成。项目页面:https://nv-tlabs.github.io/DP-Sinkhorn。
引用
@article{arxiv.2111.01177,
title = {Don't Generate Me: Training Differentially Private Generative Models with Sinkhorn Divergence},
author = {Tianshi Cao and Alex Bie and Arash Vahdat and Sanja Fidler and Karsten Kreis},
journal= {arXiv preprint arXiv:2111.01177},
year = {2022}
}
备注
Accepted to NeurIPS 2021. 13 pages, 7 pages of supplementary; 6 tables, 8 figures