中文

大语言模型赋能的隐私保护PHI标注框架

密码学与安全 2025-04-29 v1 人工智能 机器学习

摘要

医疗数据中私人信息的去标识化是缓解保密泄露风险的关键过程,尤其是在患者个人细节在发布医疗记录前未被充分删除的情况下。尽管提出了基于规则和基于学习的方法,但它们往往难以实现广泛可行性,以及需要大量标注数据才能有效运行。近期大语言模型(LLM)的快速发展在应对这些问题方面显示出巨大潜力,由于其优越的语言理解能力。然而,大语言模型也带来挑战,包括使用商业LLM API时可能的隐私风险,以及在本地部署开源LLM时的高计算成本。本文引入LPPA,一个大语言模型赋能的隐私保护PHI标注框架,用于临床笔记,针对英文语言。通过本地微调大语言模型并使用合成笔记,LPPA确保了强大的隐私保护和高水平的PHI标注准确性。大量实验表明,LPPA在准确去标识私人信息方面效果显著,为增强患者隐私保护提供了可扩展且高效的解决方案。

关键词

引用

@article{arxiv.2504.18569,
  title  = {Large Language Model Empowered Privacy-Protected Framework for PHI Annotation in Clinical Notes},
  author = {Guanchen Wu and Linzhi Zheng and Han Xie and Zhen Xiang and Jiaying Lu and Darren Liu and Delgersuren Bold and Bo Li and Xiao Hu and Carl Yang},
  journal= {arXiv preprint arXiv:2504.18569},
  year   = {2025}
}

备注

Shorter version published in MedInfo 2025