中文

面向基数计数的隐私保护记录链接

密码学与安全 2023-01-11 v1 机器学习

摘要

若干应用需要对数据中不同项的数量进行计数,即所谓的基数计数问题。例如健康应用如为充分认知与 funding 对罕见病患者计数、为新疾病暴发检测对病例数计数,营销应用如对新产品的触达可见数计数,以及网络安全应用如追踪社交媒体帖子的独立浏览数。然而计数所需数据往往是个人的且敏感,需要使用隐私保护技术进行处理。不同数据库中的数据质量(如错别字、错误与变异)给准确的基数估计带来额外挑战。尽管隐私保护基数计数近期备受关注且已开发若干隐私保护算法用于基数估计,迄今尚无工作基于具有模糊匹配与可证明隐私保证的记录链接技术开展隐私保护基数计数。我们提出一种新颖的隐私保护记录链接算法,使用无监督聚类技术在不泄露隐私或身份的情况下链接并计数多个数据集中个体的基数。此外,现有用于寻找最优簇数作为基数的 Elbow 方法远不够准确,因其未考虑生成簇的纯度和完整性。我们提出一种在无监督学习中寻找最优簇数的新方法。我们在真实与合成数据集上的实验结果极具前景,在隐私预算 {\epsilon} = 1.0 下,相较于最先进的模糊匹配与聚类方法,误差率显著更小且低于 0.1。

关键词

引用

@article{arxiv.2301.04000,
  title  = {Privacy-Preserving Record Linkage for Cardinality Counting},
  author = {Nan Wu and Dinusha Vatsalan and Mohamed Ali Kaafar and Sanath Kumar Ramesh},
  journal= {arXiv preprint arXiv:2301.04000},
  year   = {2023}
}