中文

Local Obfuscation by GLINER for Impartial Context Aware Lineage: 开发与评估基于上下文感知的 PII 移除系统

计算与语言 2025-10-23 v1

摘要

从电子健康记录(EHR)中的临床笔记中移除可识别个人信息(PII)是实现科研和人工智能开发的必不可少步骤。虽然大型语言模型(LLM)功能强大,但其高计算成本以及 API 服务带来的数据隐私风险限制了其应用,尤其是在资源受限的环境中。为此,我们开发了 LOGICAL(Local Obfuscation by GLINER for Impartial Context-Aware Lineage),一个基于微调的通用轻量命名实体识别(GLiNER)模型构建的、高效且可本地部署的 PII 移除系统。我们使用来自精神科医院 EHR 系统的 1515 份临床文档。我们定义了九类 PII 用于移除。对模型 modern-gliner-bi-large-v1.0 进行微调,采用 2849 条文本实例,并在 376 条测试实例上进行评估,使用字符级精确率、召回率和 F1 分数。我们将其性能与 Microsoft Azure NER、Microsoft Presidio 以及使用 Gemini-Pro-2.5 和 Llama-3.3-70B-Instruct 的零样本提示进行比较。微调的 GLiNER 模型取得了优异的性能,总体微平均 F1 分数达到 0.980,显著优于 Gemini-Pro-2.5(F1 分数:0.845)。LOGICAL 正确地对 95% 的文档进行完全匿名化处理,而下一最佳方案仅为 64%。该模型可在标准笔记本电脑上无需专用 GPU 的情况下高效运行。然而,2% 的实体级假阴性率凸显了所有测试系统都需要人工审核验证的必要性。微调的、专门的变换器模型如 GLiNER 提供了一个在准确性、计算效率和安全性方面均表现优异的解决方案,用于临床笔记的 PII 移除。这种“源头匿名化”方法是资源密集型 LLM 的实用替代方案,使能够在保持数据隐私的前提下,为科研和 AI 开发创建去标识化数据集,尤其在资源受限的环境中具有重要意义。

关键词

引用

@article{arxiv.2510.19346,
  title  = {Local Obfuscation by GLINER for Impartial Context Aware Lineage: Development and evaluation of PII Removal system},
  author = {Prakrithi Shivaprakash and Lekhansh Shukla and Animesh Mukherjee and Prabhat Chand and Pratima Murthy},
  journal= {arXiv preprint arXiv:2510.19346},
  year   = {2025}
}

备注

30 pages, 15 main text and 15 supplementary material