评估匿名数据遭受攻击导致再识别的风险
机器学习
2022-04-01 v1 密码学与安全
摘要
目的:将常规获取的医疗数据用于研究目的,需要通过数据匿名化保护患者隐私。本工作的目标是计算下述对匿名数据集恶意攻击所导致的再识别风险。方法:我们首先提出一种分析方法,用于估计 k-匿名化电子健康记录(EHR)数据集中单个患者再识别的概率。其次,我们将该解推广以获得多个患者被再识别的概率。我们通过蒙特卡洛模拟提供合成验证,以说明所得估计的准确性。结果:所提出的风验估计分析框架给出的再识别概率在多种场景下与模拟结果一致。我们的工作受保守假设限制,其夸大了再识别概率。讨论:我们的估计表明,再识别概率随恶意获取的数据集比例增加而增加,且与等价类大小呈反比关系。我们的递归方法将适用域扩展至任意 k-匿名化方案中多患者再识别攻击的一般情形。结论:我们规定了一种基于预定再识别概率对 k-匿名化过程进行参数化的系统方法。我们观察到,当基于对手恶意获取的数据集部分大小对再识别概率进行基准测试时,增大 k 值所带来的再识别风险降低的收益可能不抵数据粒度降低的代价。
引用
@article{arxiv.2203.16921,
title = {Assessing the risk of re-identification arising from an attack on anonymised data},
author = {Anna Antoniou and Giacomo Dossena and Julia MacMillan and Steven Hamblin and David Clifton and Paula Petrone},
journal= {arXiv preprint arXiv:2203.16921},
year = {2022}
}