中文

基于置信度排序的从已发布统计中重建人口普查微数据

计算机与社会 2023-03-29 v2 密码学与安全 机器学习

摘要

对私有数据集 DD 的重建攻击以关于该数据集的某些公开可访问信息为输入,并输出 DD 的候选元素列表。我们引入了一类基于非凸优化随机方法的新数据重建攻击。我们通过实验证明,我们的攻击不仅能从聚合查询统计 Q(D)RmQ(D)\in \mathbb{R}^m 重建 DD 的完整行,而且能以可靠地对重建行按其出现在私有数据中的概率进行排序的方式实现,从而提供一种可用于优先处理重建行以采取进一步行动(如身份盗窃或仇恨犯罪)的标记。我们还设计了一系列用于评估重建攻击的基线。我们的攻击显著优于仅基于访问公开分布或从中采样私有数据集 DD 的总体分布的攻击,表明它们利用了聚合统计 Q(D)Q(D) 中的信息,而非仅仅是分布的整体结构。换言之,查询 Q(D)Q(D) 允许重建该数据集的元素,而非 DD 所来自的分布。这些发现基于 2010 年美国十年一次人口普查数据与查询,以及源于人口普查的美国社区调查数据集得以确立。综上,我们的方法与实验说明了发布大型数据集数值精确聚合统计的风险,并为审慎应用可证明隐私技术(如差分隐私)提供了进一步动机。

关键词

引用

@article{arxiv.2211.03128,
  title  = {Confidence-Ranked Reconstruction of Census Microdata from Published Statistics},
  author = {Travis Dick and Cynthia Dwork and Michael Kearns and Terrance Liu and Aaron Roth and Giuseppe Vietri and Zhiwei Steven Wu},
  journal= {arXiv preprint arXiv:2211.03128},
  year   = {2023}
}