不是医生的处方:调查基于LLM的去标识化并量化临床信息丢失
计算与语言
2025-09-19 v1
摘要
在医疗环境中,去标识化是自然语言处理的一个应用领域,利用自动化算法移除患者(有时也是提供者)的个人识别信息。随着生成式大型语言模型(LLM)的兴起,应用LLM进行去标识化的论文数量也随之增加。尽管这些方法常报告接近完美的结果,但关于可重复性和研究实用性的挑战仍然存在。本文识别了当前文献中的三个关键局限性:报告指标不一致导致无法进行直接比较,传统分类指标不足以捕捉LLM可能更易出错的错误(即改变临床相关信息),以及缺乏对旨在量化这些错误的自动化指标的手动验证。为此,我们首先呈现了LLM-based去标识化研究的概览,强调报告标准的异质性。其次,我们评估了多样化的模型,以量化不恰当移除临床信息的程度。接着,我们采用临床专家进行现有评估指标的手动验证,以衡量移除临床信息的效果。我们强调了较差的性能并描述了此类指标在识别临床显著性变化方面的固有局限性。最后,我们提出一种新方法,用于检测临床相关信息的移除。
引用
@article{arxiv.2509.14464,
title = {Not What the Doctor Ordered: Surveying LLM-based De-identification and Quantifying Clinical Information Loss},
author = {Kiana Aghakasiri and Noopur Zambare and JoAnn Thai and Carrie Ye and Mayur Mehta and J. Ross Mitchell and Mohamed Abdalla},
journal= {arXiv preprint arXiv:2509.14464},
year = {2025}
}
备注
Accepted to EMNLP 2025