用于私有合成数据发布的新预言机高效算法
机器学习
2020-07-13 v1 数据结构与算法
机器学习
摘要
我们提出三种用于构建差分私有合成数据的新算法——合成数据是对敏感数据集的净化版本,近似保留大量统计查询的回答。所有三种算法都是\emph{预言机高效的},即在给定优化预言机访问权限时计算高效。此类预言机可使用许多现有的(非私有)优化工具实现,例如复杂的整数规划求解器。虽然合成数据的准确性取决于预言机的优化性能,但算法即使在最坏情况下也满足差分隐私。对于所有三种算法,我们提供了准确性和隐私性的理论保证。通过实证评估,我们证明我们的方法在数据的维度和查询数量上均能良好扩展。与 SOTA 方法高维矩阵机制 \cite{McKennaMHM18} 相比,我们的算法在大数据量和强隐私机制(对应于低隐私损失 )下提供了更好的准确性。
引用
@article{arxiv.2007.05453,
title = {New Oracle-Efficient Algorithms for Private Synthetic Data Release},
author = {Giuseppe Vietri and Grace Tian and Mark Bun and Thomas Steinke and Zhiwei Steven Wu},
journal= {arXiv preprint arXiv:2007.05453},
year = {2020}
}