开放世界中的健康数据
计算机与社会
2017-12-18 v1 密码学与安全
摘要
为了给有关数据共享与隐私的合理政策制定提供信息,我们描述了在澳大利亚一个去标识化的开放健康数据集中对患者成功进行再识别的情况。正如以往对类似数据集的研究所示,一些平凡的事实往往足以孤立出个体。有些人可根据公开可得的信息按姓名被识别。降低单元记录级数据的精度,或对其作统计扰动,会以相当大的效用代价使再识别逐渐变难。我们还考察了相关数据集在提升再识别准确性与置信度方面的价值。我们的再识别是在一个10%的样本数据集上进行的,但一个相关的澳大利亚开放数据集使我们能以高置信度推断样本中的某些个体已被正确再识别。最后,我们考察了这些开放数据集与某些已知存在但不在我们手中的商业数据集的结合。我们表明它们会进一步提高再识别的容易程度。
引用
@article{arxiv.1712.05627,
title = {Health Data in an Open World},
author = {Chris Culnane and Benjamin I. P. Rubinstein and Vanessa Teague},
journal= {arXiv preprint arXiv:1712.05627},
year = {2017}
}