中文

差分隐私异质电子健康记录生成

机器学习 2020-06-08 v1 机器学习

摘要

电子健康记录(EHRs)通常被机器学习界用于研究与医疗保健和医学具体相关的问题。EHRs 的优势在于易于分发且包含许多对例如分类问题有用的特征。使 EHR 数据集不同于典型机器学习数据集的是,由于其高维性,它们通常非常稀疏,且常包含异质(混合)数据类型。此外,这些数据集涉及敏感信息,由于隐私担忧,限制了使用它们学到的任何模型的分发。出于这些原因,在实践中使用 EHR 数据提出了真正的挑战。在本工作中,我们探索使用生成对抗网络(GAN)生成合成的异质 EHR,目标是将这些合成记录替代现有数据集用于下游分类任务。我们将进一步探索应用差分隐私(DP)保持优化以产生 DP 合成 EHR 数据集,其提供严格的隐私保证,因此在现实世界中可共享且可用。在我们的模型合成异质数据上(通过 AUROC、AUPRC 和准确率衡量)的性能,在非 DP 模型用于二分类任务测试时非常接近原始数据集(在基线的 3 - 5% 以内)。使用强 (1,105)(1, 10^{-5}) DP,我们的模型仍产生对机器学习任务有用的数据,尽管在我们测试的分类任务中招致约 17% 的性能损失。我们额外进行了子群体分析,发现就非 DP 或 DP 变体在男性/女性群体或 0-18、19-50 和 51+ 年龄组的分类性能而言,我们的模型相较于基线未向合成 EHR 数据中引入任何偏差。

关键词

引用

@article{arxiv.2006.03423,
  title  = {Generation of Differentially Private Heterogeneous Electronic Health Records},
  author = {Kieran Chin-Cheong and Thomas Sutter and Julia E. Vogt},
  journal= {arXiv preprint arXiv:2006.03423},
  year   = {2020}
}