大语言模型赋能的隐私保护PHI标注框架
密码学与安全
2025-04-29 v1 人工智能
机器学习
摘要
医疗数据中私人信息的去标识化是缓解保密泄露风险的关键过程,尤其是在患者个人细节在发布医疗记录前未被充分删除的情况下。尽管提出了基于规则和基于学习的方法,但它们往往难以实现广泛可行性,以及需要大量标注数据才能有效运行。近期大语言模型(LLM)的快速发展在应对这些问题方面显示出巨大潜力,由于其优越的语言理解能力。然而,大语言模型也带来挑战,包括使用商业LLM API时可能的隐私风险,以及在本地部署开源LLM时的高计算成本。本文引入LPPA,一个大语言模型赋能的隐私保护PHI标注框架,用于临床笔记,针对英文语言。通过本地微调大语言模型并使用合成笔记,LPPA确保了强大的隐私保护和高水平的PHI标注准确性。大量实验表明,LPPA在准确去标识私人信息方面效果显著,为增强患者隐私保护提供了可扩展且高效的解决方案。
引用
@article{arxiv.2504.18569,
title = {Large Language Model Empowered Privacy-Protected Framework for PHI Annotation in Clinical Notes},
author = {Guanchen Wu and Linzhi Zheng and Han Xie and Zhen Xiang and Jiaying Lu and Darren Liu and Delgersuren Bold and Bo Li and Xiao Hu and Carl Yang},
journal= {arXiv preprint arXiv:2504.18569},
year = {2025}
}
备注
Shorter version published in MedInfo 2025