突破高维隐私的维数灾难:扩展版
数据库
2014-01-07 v1
摘要
维数灾难一直是数据挖掘、聚类、分类和隐私保护领域各种算法面临的挑战。最近的研究表明,维度的增加使得数据难以进行有效的隐私保护。理论结果似乎暗示维数灾难是隐私保护的根本障碍。然而,在实践中,我们表明可以利用真实数据的某些常见属性来极大地缓解维数灾难的负面影响。在真实数据集中,许多维度包含高水平的属性间相关性。这种相关性使得能够使用一种称为垂直分解(vertical fragmentation)的过程,将数据分解为维度较小的垂直子集。垂直分解过程使用了基于互信息的信息论准则。这使得可以采用一种匿名化过程,该过程基于组合多个独立片段的结果。我们提出了一种通用方法,可应用于 k-匿名(k-anonymity)、l-多样性(l-diversity)和 t-接近性(t-closeness)模型。在存在属性间相关性的情况下,这种方法在更高维度下依然更加稳健,且不会损失准确性。我们展示了说明该方法有效性的实验结果。该方法足以防止身份披露、属性披露和成员披露攻击。
引用
@article{arxiv.1401.1174,
title = {Towards Breaking the Curse of Dimensionality for High-Dimensional Privacy: An Extended Version},
author = {Hessam Zakerzadeh and Charu C. Aggrawal and Ken Barker},
journal= {arXiv preprint arXiv:1401.1174},
year = {2014}
}
备注
13 pages, An extended version of the paper accepted in 2014 SIAM international conference on Data Mining