私有人口数据发布机制基准评测:合成数据 vs. TopDown
密码学与安全
2024-04-03 v2
摘要
差分隐私(DP)越来越多地用于保护分层、表格化人口数据(如普查数据)的发布。在此场景中实现差分隐私的一种常见方法是发布对一组预定义查询的噪声响应。例如,美国人口普查局使用的 TopDown 算法就是这种方法。这类方法有一个重要缺点:它们无法回答未针对其进行优化的查询。一个颇具吸引力的替代方案是生成差分隐私合成数据,这些数据从某个生成分布中抽取。与 TopDown 方法类似,合成数据也可以针对特定查询进行优化,同时允许数据用户稍后对合成人口数据提交任意查询。据我们所知,目前尚无对这些方法进行头对头的实证比较。本研究在 TopDown 算法与差分隐私合成数据生成之间进行了这样的比较,以确定查询复杂性、分布内与分布外查询以及隐私保证如何影响准确性。我们的结果表明,对于分布内查询,TopDown 算法实现的隐私-保真度权衡显著优于我们评估的任何合成数据方法;例如,在我们的实验中,在相同隐私预算下,TopDown 在计数查询上的误差至少比领先的合成数据方法低 。我们的发现为从业者和合成数据研究社区提供了指导建议。
引用
@article{arxiv.2401.18024,
title = {Benchmarking Private Population Data Release Mechanisms: Synthetic Data vs. TopDown},
author = {Aadyaa Maddi and Swadhin Routray and Alexander Goldberg and Giulia Fanti},
journal= {arXiv preprint arXiv:2401.18024},
year = {2024}
}
备注
The 5th AAAI Workshop on Privacy-Preserving Artificial Intelligence