中文

SHIELD: 面向企业规模的临床记录数据集与蒸馏小型语言模型用于去识别

计算与语言 2026-05-06 v1 人工智能

摘要

临床文本去识别仍是电子健康记录(EHR)二次使用不可或缺的步骤,但诸如i2b2 2006/2014等公共基准已过去十余年,缺乏现代叙述的语义和人口学多样性。虽然大语言模型(LLM)实现了零样本提取的最先进性能,但企业部署受限于计算成本和治理要求将受保护健康信息(PHI)从云端API中隔离。我们引入SHIELD(Synthetic Human-annotated Identifier-replaced Entries for Learning and De-identification),这是一个包含1,394篇笔记、10,505个金标准PHI片段、覆盖9个类别的多样化数据集,采用集合覆盖多样性抽样结合人工审核构建。我们评估了四个LLM(两款专有,两款开源)以建立性能上限,然后将这些能力蒸馏到可本地部署的小型语言模型(SLM)。使用Frechet 文本距离和Jensen-Shannon 散度进行的分布分析表明,SHIELD在生物医学嵌入和词汇空间中占据与历史基准的不同位置。我们最佳的蒸馏模型在结构化PHI类别(DATE、DOCTOR、ID、PATIENT、PHONE)上匹配其教师,实现了在标准工作站硬件上的0.88的微平均精确率和0.86的召回率。在跨数据集评估中, diversity训练的模型在通用结构化PHI上具有良好的泛化能力,而机构特定实体难以迁移,这表明最佳部署应结合广泛覆盖的模型与针对高频笔记的专用模型。我们公开了SHIELD数据集和蒸馏版DeBERTa v3模型。

关键词

引用

@article{arxiv.2605.03301,
  title  = {SHIELD: A Diverse Clinical Note Dataset and Distilled Small Language Models for Enterprise-Scale De-identification},
  author = {Jose D. Posada and David Love and Somalee Datta and Priya Desai},
  journal= {arXiv preprint arXiv:2605.03301},
  year   = {2026}
}