中文

基于划分的差分隐私合成数据生成

密码学与安全 2023-10-11 v1 机器学习

摘要

相比于汇总统计量,私有合成数据共享更受青睐,因为它保留了原始数据的分布与细节特征。现有最优方法采用选择-度量-生成范式,但度量大定义域边际仍会产生较大误差,且迭代分配隐私预算依然困难。为解决这些问题,我们的方法采用基于划分的策略,即使在有限隐私预算下也能有效降低误差并提升合成数据质量。实验结果表明,我们的方法优于现有方法。采用我们的方法生成的合成数据展现出更优的质量与效用,使其成为私有合成数据共享的更优选择。

关键词

引用

@article{arxiv.2310.06371,
  title  = {Partition-based differentially private synthetic data generation},
  author = {Meifan Zhang and Dihang Deng and Lihua Yin},
  journal= {arXiv preprint arXiv:2310.06371},
  year   = {2023}
}