中文

保护隐私的位置数据发布:一种机器学习方法

机器学习 2019-11-06 v2 密码学与安全

摘要

发布数据集在开放数据研究以及促进政府机构透明度方面起着至关重要的作用。然而,此类数据发布可能会泄露用户的私人信息。最敏感的数据源之一是时空轨迹数据集。遗憾的是,仅移除唯一标识符无法保护用户隐私。对手可能知道部分轨迹,或者能够将发布的数据集与其他来源关联以进行用户识别。因此,在发布时空轨迹数据集之前应用隐私保护技术至关重要。本文提出了一个用于时空轨迹数据集匿名化的鲁棒框架,称为基于机器学习的匿名化(MLA)。通过引入该问题的新形式化,我们得以应用机器学习算法对轨迹进行聚类,并提议为此使用 kk-means 算法。还提出了一种 kk-means 算法的变体,以在高度敏感的数据集中保护隐私。此外,我们通过将多重序列比对作为 MLA 的一部分来改进比对过程。该框架及所有提出的算法应用于 TDrive 和 Geolife 位置数据集。实验结果表明,基于 MLA 框架的匿名化显著提高了数据集的效用。

关键词

引用

@article{arxiv.1902.08934,
  title  = {Privacy Preserving Location Data Publishing: A Machine Learning Approach},
  author = {Sina Shaham and Ming Ding and Bo Liu and Shuping Dang and Zihuai Lin and Jun Li},
  journal= {arXiv preprint arXiv:1902.08934},
  year   = {2019}
}