合成医疗数据的保真度与隐私性
机器学习
2021-06-03 v2 人工智能
密码学与安全
摘要
医疗记录的数字化为临床科学带来了大数据的新时代,也随之带来了数据共享的可能性,从而将洞察力放大到远超研究者从纸质记录中抽象所得。为加速精准医学创新而共享个体层面医疗数据的需求持续增长,且在科学家应对 COVID-19 大流行之际从未如此迫切。然而,对大数据的使用热情因对患者自主权和隐私的完全合理的关切而受到抑制。即,在实践中提取关于个体的私人或机密信息的能力,使得数据共享困难,因为在共享数据之前必须建立重要的基础设施和数据治理。尽管 HIPAA 将去标识化作为经批准的数据共享机制,但关联攻击被确认为一个主要漏洞。已建立多种机制以避免泄露私人信息,例如字段抑制或抽象、严格限制可共享的信息量,或采用差分隐私等数学技术。我们在此关注的另一种方法是创建模仿底层数据的合成数据。为使合成数据成为支持医学创新和有真实世界证据代表性的有用机制,必须证明合成数据集的两个属性:(1)对真实数据的任何分析都必须由合成数据的分析所匹配(统计保真度);(2)合成数据必须保护隐私,再识别风险最小(隐私保证)。本文提出一个量化合成数据集的统计保真度和隐私保护属性的框架,并针对 Syntegra 技术生成的合成数据展示这些指标。
引用
@article{arxiv.2101.08658,
title = {Fidelity and Privacy of Synthetic Medical Data},
author = {Ofer Mendelevitch and Michael D. Lesh},
journal= {arXiv preprint arXiv:2101.08658},
year = {2021}
}