基于隐私化数据训练生成模型
机器学习
2024-03-04 v2 密码学与安全
信息论
math.IT
摘要
本地差分隐私是一种强大的隐私保护数据收集方法。在本文中,我们开发了一个在差分隐私化数据上训练生成对抗网络(GANs)的框架。我们表明,最优传输的熵正则化——文献中一种流行的正则化方法,常因其计算优势而被利用——使得生成器能够学习原始(未隐私化)数据分布,尽管它只能访问隐私化样本。我们证明,与此同时,这导致了在参数速率下的快速统计收敛。这表明最优传输的熵正则化独特地能够缓解隐私化噪声的影响以及统计收敛中的维度灾难。我们提供了实验证据来支持我们的框架在实践中的有效性。
引用
@article{arxiv.2306.09547,
title = {Training generative models from privatized data},
author = {Daria Reshetova and Wei-Ning Chen and Ayfer Özgür},
journal= {arXiv preprint arXiv:2306.09547},
year = {2024}
}