基于划分的差分隐私合成数据生成
密码学与安全
2023-10-11 v1 机器学习
摘要
相比于汇总统计量,私有合成数据共享更受青睐,因为它保留了原始数据的分布与细节特征。现有最优方法采用选择-度量-生成范式,但度量大定义域边际仍会产生较大误差,且迭代分配隐私预算依然困难。为解决这些问题,我们的方法采用基于划分的策略,即使在有限隐私预算下也能有效降低误差并提升合成数据质量。实验结果表明,我们的方法优于现有方法。采用我们的方法生成的合成数据展现出更优的质量与效用,使其成为私有合成数据共享的更优选择。
引用
@article{arxiv.2310.06371,
title = {Partition-based differentially private synthetic data generation},
author = {Meifan Zhang and Dihang Deng and Lihua Yin},
journal= {arXiv preprint arXiv:2310.06371},
year = {2023}
}