中文

面向 GDPR 合规的医疗数据匿名化算法流水线:迈向标准化

密码学与安全 2025-06-04 v1

摘要

高质量的真实世界数据(RWD)对医疗保健至关重要,但必须经过转换以符合《通用数据保护条例》(GDPR)。GDPR 对准标识符(QIDs)和敏感属性(SAs)的宽泛定义增加了实施难度。我们旨在通过引入一种识别 QIDs 和 SAs 并评估匿名化数据集效用的算法方法,实现面向 GDPR 合规的 RWD 匿名化标准化,同时保留数据效用。我们通过 ProQuest 和 PubMed 进行了系统性文献综述,以构建三阶段匿名化流水线:识别、去标识化和准标识符维度评估。该流水线在两个模拟 RWD 数据集(500 行和 1000 行)上进行了实现、验证和测试。隐私性通过 k-匿名、l-多样性和 t-贴近度进行评估;效用通过非均匀熵(NUE)测量。该综述得出了两项关于 QID/SA 识别的研究和五项关于效用指标的研究。应用该流水线,使用 alpha 和 beta 阈值(500 行为 25%/1%;1000 行为 10%/1%)按重标识风险对属性进行分类。隐私指标将 k-匿名从 1 提升至 4(500 行),从 1 提升至 110(1000 行)。NUE 得分分别为 69.26% 和 69.05%,表明尽管隐私增益不同,但效用保持一致。我们提出了一种面向医疗 RWD 的 GDPR 合规匿名化流水线,为 QID/SA 识别和效用评估提供了可复现的方法;公开可用的代码促进了标准化、数据隐私和开放科学。

关键词

引用

@article{arxiv.2506.02942,
  title  = {An Algorithmic Pipeline for GDPR-Compliant Healthcare Data Anonymisation: Moving Toward Standardisation},
  author = {Hamza Khan and Lore Menten and Liesbet M. Peeters},
  journal= {arXiv preprint arXiv:2506.02942},
  year   = {2025}
}