DeIDClinic:临床文本去识别的风险感知伪字符框架
计算与语言
2026-05-26 v2
摘要
敏感文本数据的日益增多的可用性创建了迫切需要稳健去识别方法的需求,以在保持下游效用性的同时实现合规数据共享。本文提出了DeID-Clinic,一个用于自动化伪字符化和再识别风险评估的多层次框架,用于临床自由文本数据。我们的方案将域适应变形模型(包括BioBERT和ClinicalBERT)集成到MASK去识别框架中,以提高对受保护健康信息(PHI)的检测和掩码能力。除实体识别外,我们引入了一种新颖的文档级风险评估模块,通过结合k-匿名性、l-多样性、t-接近性、情境相似性和实体共现分析来量化残余再识别风险。在i2b2 2014去识别数据集上的实验表明,实现了对多个实体类别的宏级F1分数>0.96的优异性能,同时实现了对高风险文档进行量化优先级排序以进行进一步审查。我们的结果凸显了将神经网络去识别与显式风险建模相结合的有效性,支持敏感领域的数据共享。虽然在临床文本上进行了评估,但该框架可推广到其他隐私关键领域(如法律和行政文档),其中可靠的伪字符化和风险感知匿名化至关重要。
引用
@article{arxiv.2410.01648,
title = {DeIDClinic: A Risk-Aware Pseudonymization Framework for Clinical Text De-identification and Re-identification Risk Assessment},
author = {Angel Paul and Dhivin Shaji and Lifeng Han and Warren Del-Pinto and Goran Nenadic and Suzan Verberne},
journal= {arXiv preprint arXiv:2410.01648},
year = {2026}
}
备注
Accepted by and Presented at: LEGAL-CALD-Pseudo2026 @LREC2026