私有合成数据的迭代方法:统一框架与新方法
机器学习
2021-12-10 v2 密码学与安全
数据结构与算法
摘要
我们研究用于查询发布的私有合成数据生成,其目标是在差分隐私约束下构造敏感数据集的净化版本,以近似保留大量统计查询的答案。我们首先提出一个算法框架,统一了文献中一长串迭代算法。在此框架下,我们提出两种新方法。第一种方法,私有熵投影(PEP),可视为MWEM的一种进阶变体,其自适应地复用过去的查询测量以提升精度。我们的第二种方法,采用指数机制的生成网络(GEM),通过在由神经网络参数化的生成模型上优化,规避了MWEM和PEP等算法中的计算瓶颈,这类模型刻画了丰富的分布族同时支持快速基于梯度的优化。我们证明PEP与GEM在经验上优于现有算法。此外,我们展示GEM能很好地融入来自公共数据的先验信息,同时克服同样利用公共数据的现有最先进方法PMW^Pub的局限性。
引用
@article{arxiv.2106.07153,
title = {Iterative Methods for Private Synthetic Data: Unifying Framework and New Methods},
author = {Terrance Liu and Giuseppe Vietri and Zhiwei Steven Wu},
journal= {arXiv preprint arXiv:2106.07153},
year = {2021}
}
备注
NeurIPS 2021