DIRI: 利用大语言模型进行对抗性患者重识别以评估临床文本匿名化
计算与语言
2024-10-23 v1
摘要
共享受保护健康信息(PHI)对于推进生物医学研究至关重要。在数据分发之前,从业者通常会进行去标识化处理,以移除文本中包含的任何PHI。当前的去标识化方法在高度饱和的数据集上进行评估(工具达到近乎完美的准确率),这可能无法反映真实世界临床文本的全部变异性或复杂性,并且对其进行标注需要大量资源,这成为实际应用的障碍。为弥补这一差距,我们开发了一种对抗性方法,使用大语言模型(LLM)来重新识别与已编辑临床记录相对应的患者,并通过一种新颖的去标识化/重识别(DIRI)方法评估性能。我们的方法使用大语言模型来重新识别与已编辑临床记录相对应的患者。我们在来自威尔康奈尔医学院的医学数据上演示了我们的方法,这些数据使用了三种去标识化工具进行匿名化:基于规则的Philter以及两种基于深度学习的模型BiLSTM-CRF和ClinicalBERT。尽管ClinicalBERT最为有效,掩盖了所有识别出的PII,但我们的工具仍然重新识别了9%的临床记录。我们的研究揭示了当前去标识化技术的显著弱点,同时为迭代开发和改进提供了一个工具。
引用
@article{arxiv.2410.17035,
title = {DIRI: Adversarial Patient Reidentification with Large Language Models for Evaluating Clinical Text Anonymization},
author = {John X. Morris and Thomas R. Campion and Sri Laasya Nutheti and Yifan Peng and Akhil Raj and Ramin Zabih and Curtis L. Cole},
journal= {arXiv preprint arXiv:2410.17035},
year = {2024}
}