去标识化并不足够:去标识化与合成临床病历的比较
计算与语言
2025-03-05 v2
摘要
在共享隐私敏感数据时,去标识化通常被视为保护隐私的充分手段。合成数据也被视为一种保护隐私的替代方案。数值与表格数据生成模型近期的成功,以及大型生成式语言模型的突破,引发了这样一个问题:对于研究目的而言,合成的临床病历是否能成为真实病历的可行替代方案。在本工作中,我们证明了: 真实临床病历的去标识化无法保护记录免受成员推断攻击; 提出了一种利用当前最先进的大型语言模型生成合成临床病历的新方法; 在一项临床领域任务中评估了合成生成病历的性能; 提出了一种针对使用合成数据训练的目标模型实施成员推断攻击的方法。我们观察到,当合成生成的病历在性能上与真实数据高度匹配时,它们也表现出与真实数据相似的隐私隐患。其他合成临床病历生成方法是否能提供更好的权衡并成为敏感真实病历的更优替代方案,仍有待进一步研究。
引用
@article{arxiv.2402.00179,
title = {De-identification is not enough: a comparison between de-identified and synthetic clinical notes},
author = {Atiquer Rahman Sarkar and Yao-Shun Chuang and Noman Mohammed and Xiaoqian Jiang},
journal= {arXiv preprint arXiv:2402.00179},
year = {2025}
}
备注
https://www.nature.com/articles/s41598-024-81170-y