中文

保护与扩展——利用 GAN 生成时间序列医疗记录的合成数据

机器学习 2024-03-04 v2 人工智能 密码学与安全

摘要

保护用户隐私数据对于高质量体验(QoE)和可接受性至关重要,特别是在处理敏感数据的服务(如基于 IT 的医疗服务)中。虽然匿名化技术已被证明容易受到数据重识别攻击,但合成数据生成已逐渐取代匿名化,因为它相对更节省时间和资源,并且对数据泄露更具鲁棒性。生成对抗网络(GAN)已被用于生成合成数据集,尤其是遵循差分隐私现象的 GAN 框架。本研究比较了最先进的基于 GAN 的合成数据生成模型,以生成可无隐私顾虑分发的痴呆症患者时间序列合成医疗记录。我们使用预测建模、自相关和分布分析来评估生成数据的质量(QoG)。通过应用成员推理攻击来确定潜在的数据泄露风险,从而评估各模型的隐私保护能力。我们的实验表明,隐私保护 GAN(PPGAN)模型在保持可接受的 QoG 水平的同时,在隐私保护方面优于其他模型。所展示的结果可为未来医疗用例提供更好的数据保护支持。

关键词

引用

@article{arxiv.2402.14042,
  title  = {Protect and Extend -- Using GANs for Synthetic Data Generation of Time-Series Medical Records},
  author = {Navid Ashrafi and Vera Schmitt and Robert P. Spang and Sebastian Möller and Jan-Niklas Voigt-Antons},
  journal= {arXiv preprint arXiv:2402.14042},
  year   = {2024}
}