中文

用于私有合成数据发布的新预言机高效算法

机器学习 2020-07-13 v1 数据结构与算法 机器学习

摘要

我们提出三种用于构建差分私有合成数据的新算法——合成数据是对敏感数据集的净化版本,近似保留大量统计查询的回答。所有三种算法都是\emph{预言机高效的},即在给定优化预言机访问权限时计算高效。此类预言机可使用许多现有的(非私有)优化工具实现,例如复杂的整数规划求解器。虽然合成数据的准确性取决于预言机的优化性能,但算法即使在最坏情况下也满足差分隐私。对于所有三种算法,我们提供了准确性和隐私性的理论保证。通过实证评估,我们证明我们的方法在数据的维度和查询数量上均能良好扩展。与 SOTA 方法高维矩阵机制 \cite{McKennaMHM18} 相比,我们的算法在大数据量和强隐私机制(对应于低隐私损失 ε\varepsilon)下提供了更好的准确性。

关键词

引用

@article{arxiv.2007.05453,
  title  = {New Oracle-Efficient Algorithms for Private Synthetic Data Release},
  author = {Giuseppe Vietri and Grace Tian and Mark Bun and Thomas Steinke and Zhiwei Steven Wu},
  journal= {arXiv preprint arXiv:2007.05453},
  year   = {2020}
}