在大语言模型时代实现稳健隐私:通过风险评估的批判性分析
计算与语言
2025-06-03 v2
摘要
本研究考察了将电子健康记录(EHR)与自然语言处理(NLP)结合运用于大语言模型(LLM)以改进医疗数据管理和患者护理的集成方案。其核心目标是利用先进模型创建符合HIPAA标准的安全人工合成患者病历,以支持生物医学研究。研究使用去标识化和重新标识化的MIMIC III数据集,分别测试GPT-3.5、GPT-4和Mistral 7B模型用于生成合成病历。文本生成采用模板方法和关键词提取,以生成具有情境相关性的病历;同时进行一次性生成以进行比较。隐私评估检查是否存在PHI(受保护健康信息),而文本实用性则通过ICD-9编码任务进行测试。文本质量则采用ROUGE和余弦相似度等指标衡量与源文本的语义相似性。分析结果显示,关键词基方法在PHI发生情况和文本实用性方面表现出低风险和良好性能;而一次性生成方法则在地理位置和日期类别中呈现出最高的PHI暴露和PHI共现现象。归一化一次性方法实现了最高的分类准确率。隐私分析揭示了数据实用性与隐私保护之间的关键平衡,这对未来的数据使用和共享方式产生深远影响。研究还发现,重新标识后的数据在隐私保护和数据可用性方面始终优于去标识化数据。本研究证明了关键词基方法在生成兼顾隐私保护与数据可用性的合成临床病历方面的有效性,potentially改变临床数据共享实践。优越的重新标识数据性能表明,未来应转向通过利用虚拟PHI来增强数据实用性和隐私保护的方法。
引用
@article{arxiv.2407.16166,
title = {Robust Privacy Amidst Innovation with Large Language Models Through a Critical Assessment of the Risks},
author = {Yao-Shun Chuang and Atiquer Rahman Sarkar and Yu-Chun Hsu and Noman Mohammed and Xiaoqian Jiang},
journal= {arXiv preprint arXiv:2407.16166},
year = {2025}
}
备注
13 pages, 4 figures, 1 table, 1 supplementary, under review