中文

私有采样:一种生成差分隐私合成数据的无噪声方法

密码学与安全 2022-06-06 v1 统计理论 统计理论

摘要

在人工智能与数据科学无处不在的世界中,数据共享日益与数据隐私担忧相冲突。差分隐私已成为在统计数据库中保护个体隐私同时释放有用统计信息的严格框架。实现差分隐私的标准方法是向数据中注入足量噪声。然而,除差分隐私的其他局限外,这种加噪过程会影响数据准确性与效用。另一种实现数据共享中隐私保护的方法基于合成数据概念。合成数据的目标是创建一个尽可能真实的数据集,既保留原始数据的细微特征,又不会暴露敏感信息的风险。将差分隐私与合成数据结合被视为两全其美的方案。本工作中,我们提出首个构建差分隐私合成数据的无噪声方法;我们通过一种称为“私有采样”的机制实现这一点。以布尔立方体为基准数据模型,我们推导了所构建合成数据在准确性与隐私性上的显式界。关键数学工具为超收缩性、对偶性与经验过程。我们私有采样机制的核心要素是一种严格的“边际校正”方法,其具有可利用重要性重加权精确匹配样本与总体边际的显著性质。

关键词

引用

@article{arxiv.2109.14839,
  title  = {Private sampling: a noiseless approach for generating differentially private synthetic data},
  author = {March Boedihardjo and Thomas Strohmer and Roman Vershynin},
  journal= {arXiv preprint arXiv:2109.14839},
  year   = {2022}
}