中文

医疗数据共享中隐私与性能权衡的解析方法

应用统计 2025-08-27 v1 机器学习

摘要

医疗数据的二次使用对研究和临床创新至关重要,但也引发了患者隐私 concerns。本研究从数据提供方和数据用户的角度,探讨如何在医疗数据共享中平衡隐私保护与数据实用性。我们使用 2013 年至 2015 年住院成年患者的数据集,预测是否在入院时或在住院期间出现了败血症。我们识别出包括老年人、频繁住院患者和种族少数族裔在内的亚群体,这些人因其独特的人口统计和医疗利用属性组合,特别容易受到隐私攻击。这些群体也是机器学习(ML)模型性能的关键。我们评估了三种匿名化方法——kk-匿名化、Zheng 等人的方法和基于 MO-OBAM 的模型方法——其在降低重新识别风险同时维持 ML 实用性的能力。结果表明,kk-匿名化的保护作用有限。Zheng 等人的方法和 MO-OBAM 方法提供了更强的隐私保障,MO-OBAM 在实用性方面效果最佳:仅比原始数据集在精确度和召回率上下降 2%。本工作为医疗组织提供了在负责任地共享数据方面的可操作性见解。我们强调,匿名化方法需要在保护脆弱人群的隐私而不牺牲数据驱动模型性能之间取得平衡。

关键词

引用

@article{arxiv.2508.18513,
  title  = {An Analytical Approach to Privacy and Performance Trade-Offs in Healthcare Data Sharing},
  author = {Yusi Wei and Hande Y. Benson and Muge Capan},
  journal= {arXiv preprint arXiv:2508.18513},
  year   = {2025}
}