中文

集合值数据的多元微聚合

密码学与安全 2022-04-05 v1

摘要

数据控制者管理着海量数据,并偶尔将其公开发布以协助研究人员开展研究。然而,这些公开共享的数据可能包含可用于重新识别个人的个人可识别信息(PII)。因此,在公开发布之前,需要一种有效的匿名化机制来对这些数据进行匿名处理。微聚合是统计披露控制(SDC)方法之一,被许多研究人员广泛使用。该方法采用k-匿名原则,在同一簇中生成k个不可区分的记录,以保护个人的隐私。然而,在这些方法中,簇的大小是固定的(即k条记录),且通过这些方法生成的簇可能包含非同质记录。考虑到这些问题,我们提出了一种自适应大小聚类技术,将同质记录聚合到相似的簇中,并且簇的大小在记录的语义分析之后确定。为此,我们扩展了MDAV微聚合算法,依靠分类数据库(即WordNet)对非结构化记录进行语义分析,然后将它们聚合到同质簇中。此外,我们提出了一种距离度量,用于确定记录彼此之间的差异程度,并基于此构建同质自适应簇。在实验中,我们测量了簇的内聚性以评估记录的同质性。另外,提出了一种方法来衡量由编辑方法引起的信息损失。实验结果表明,所提出的机制优于现有的最先进解决方案。

关键词

引用

@article{arxiv.2204.01305,
  title  = {Multivariate Microaggregation of Set-Valued Data},
  author = {Malik Imran-Daud and Muhammad Shaheen and Abbas Ahmed},
  journal= {arXiv preprint arXiv:2204.01305},
  year   = {2022}
}