中文

现实世界中的隐私保护合成位置数据

数据库 2021-08-25 v1 密码学与安全

摘要

共享敏感数据对于实现许多现代数据分析和机器学习任务至关重要。然而,当前的数据发布方法在准确性或粒度上不足以提供有意义的效用,并且存在较高的去匿名化或成员推断攻击风险。在本文中,我们提出了一种差分隐私合成数据生成方案,重点关注位置数据这一引人注目的领域。我们提出了两种具有高实际效用的从真实位置生成合成位置数据的方法,这两种方法均保护原始数据集中每个个体的存在性和真实位置。第一种基于划分的方法引入了一种使用核密度估计 privately 生成点数据的新方法,并采用了经典统计技术(如聚类)的隐私自适应版本以进行隐私划分。第二种基于网络的方法结合公开地理信息(如城市路网)来约束合成数据点的边界,从而提高合成数据的准确性。两种方法均满足差分隐私的要求,同时能够准确生成旨在保留真实位置分布的合成数据。我们使用三个大规模位置数据集进行实验,表明所提出的方案生成的合成位置数据具有高效用且与真实数据集高度相似。我们通过将合成数据应用于一系列位置分析查询来突出我们工作的一些实际应用,并证明与使用真实数据时相比,我们的合成数据对相同查询产生近乎一致的答案。我们的结果表明,所提出的方法是用于隐私共享和分析敏感位置数据的实用方案。

关键词

引用

@article{arxiv.2108.02089,
  title  = {Privacy-Preserving Synthetic Location Data in the Real World},
  author = {Teddy Cunningham and Graham Cormode and Hakan Ferhatosmanoglu},
  journal= {arXiv preprint arXiv:2108.02089},
  year   = {2021}
}