AnomiGAN:用于匿名化私人医疗数据的生成对抗网络
密码学与安全
2019-02-01 v1 机器学习
摘要
典型的个人医疗数据包含关于个体的敏感信息。因此存储或共享个人医疗数据通常存在风险。例如,一段短DNA序列不仅能识别个体,还能识别其亲属。尽管如此,大多数国家和研究人员都同意收集个人医疗数据的必要性。这源于这样一个事实:包括基因组数据在内的医疗数据是关于疾病预防和治疗的进一步研究与开发不可或缺的资源。为防止个人医疗数据被滥用,应开发能在现实应用中可靠保护敏感信息的技术。在本文中,我们提出一种称为匿名化生成对抗网络(anonymized generative adversarial networks, AnomiGAN)的框架,以在保持高预测性能的同时改善个人医疗数据的隐私维护。我们将我们的方法与最先进的技术进行比较,观察到我们的方法保持了与差分隐私(differential privacy, DP)相同水平的隐私,但具有更好的预测结果。我们还观察到,根据原始数据保留程度的不同,隐私与性能结果之间存在权衡。在此,我们提供所提模型的数学概述,并使用UCI机器学习库数据集展示其验证,以突出其在实践中的效用。实验上,我们的方法相比DP方法提供了更好的性能。
引用
@article{arxiv.1901.11313,
title = {AnomiGAN: Generative adversarial networks for anonymizing private medical data},
author = {Ho Bae and Dahuin Jung and Sungroh Yoon},
journal= {arXiv preprint arXiv:1901.11313},
year = {2019}
}