合成数据的隐私性:一个统计框架
密码学与安全
2021-09-07 v1 统计理论
统计理论
摘要
隐私保护数据分析正成为一个具有深远影响的挑战性问题。特别地,合成数据是解决数据隐私与数据共享之间悖论冲突的一种有前景的概念。然而,已知对某些类型准确生成私有的合成数据是 NP-hard 的。我们为差分私有合成数据开发了一个统计框架,使我们能够规避该问题的计算困难。我们将真实数据视为根据某个未知密度从总体 Omega 中抽取的随机样本。然后我们用一个小得多的随机子集 Omega^* 替换 Omega,该子集根据某个已知密度抽样。我们通过在真实数据上获得的指定线性统计量,在归约空间 Omega^* 上生成合成数据。为保障隐私,我们使用常见的拉普拉斯机制。采用 Rényi 条件数的概念(其衡量采样分布与总体分布的相关程度),我们推导了所提方法在隐私与准确性方面的显式界。
引用
@article{arxiv.2109.01748,
title = {Privacy of synthetic data: a statistical framework},
author = {March Boedihardjo and Thomas Strohmer and Roman Vershynin},
journal= {arXiv preprint arXiv:2109.01748},
year = {2021}
}