具有层次结构的隐私合成数据
机器学习
2022-06-14 v1
摘要
我们研究层次数据集的差分隐私合成数据生成问题,其中个体数据点被分组在一起(例如家庭中的人)。特别地,为衡量合成数据集与底层私有数据集之间的相似性,我们将目标置于隐私查询发布问题下,生成保留某些查询集合答案(即均值聚合计数等统计量)的合成数据集。然而,尽管隐私合成数据在查询发布问题上的应用已被充分研究,此类研究仅限于非层次数据域,这引出了初始问题——考虑此种形式的数据时哪些查询是重要的?此外,如何同时在组级与个体级生成捕获此类统计量的合成数据尚待确立。鉴于这些挑战,我们首先形式化了层次查询发布问题,其目标是发布层次数据集的某组统计量。具体而言,我们提供了一组捕获组级与个体级属性间关系的通用统计查询。随后,我们引入用于层次查询发布的隐私合成数据算法,并在源自美国社区调查与 Allegheny 家庭筛查工具数据的层次数据集上评估它们。最后,我们着眼于美国社区调查,其固有的层次结构催生了另一组特定域查询,我们据此开展了实验。
引用
@article{arxiv.2206.05942,
title = {Private Synthetic Data with Hierarchical Structure},
author = {Terrance Liu and Zhiwei Steven Wu},
journal= {arXiv preprint arXiv:2206.05942},
year = {2022}
}