基于小型语言模型的儿童病理报告半自动标注工作流程
计算与语言
2026-04-08 v2 信息检索
摘要
电子病历系统 (EPR) 包含大量临床信息,但其中大部分被困于非结构化文本中,限制了其在研究和决策中的应用。大型语言模型能够提取此类信息,但需要大量计算资源才能在本地运行,而将敏感临床数据发送到云端服务,即使经过去标识化处理,也会引发重大的患者隐私担忧。本研究开发了基于小型语言模型 (SLM) 的资源高效半自动标注工作流程,用于从非结构化 EPR 数据中提取结构化信息,聚焦于儿童病理学报告。作为概念验证,我们将该工作流程应用于儿童肾活检报告,该领域因其受限的诊断范围和明确的生物学基础而被选择。我们在三个临床评审会议中进行迭代开发,手动标注 400 份来自 2111 份数据的报告作为金标准,同时开发基于 SLM 的自动信息提取方法。我们将提取任务以问答形式完成,借助临床医生引导的实体指南和零样本示例进行 grounding,评估五个经过指令微调的 SLM,采用不一致建模框架优先考虑临床审阅的报告。Gemma 2 2B 在准确率达到 84.3% 时取得最佳成绩,超越包括 spaCy (74.3%)、BioBERT-SQuAD (62.3%)、RoBERTa-SQuAD (59.7%) 和 GLiNER (60.2%) 等即插即用模型。实体指南相对于零样本基线提升了 7-19% 的性能,零样本示例提升了 6-38%,但两者组合的益处并不叠加。这些结果表明,SLM 能够在仅使用 CPU 基础设施的情况下,从专业临床领域中提取结构化信息,且对临床医生的投入最小。我们的代码已公开于 https://github.com/gosh-dre/nlp_renal_biopsy。
引用
@article{arxiv.2604.04168,
title = {A Semi-Automated Annotation Workflow for Paediatric Histopathology Reports Using Small Language Models},
author = {Avish Vijayaraghavan and Jaskaran Singh Kawatra and Sebin Sabu and Jonny Sheldon and Will Poulett and Alex Eze and Daniel Key and John Booth and Shiren Patel and Jonny Pearson and Dan Schofield and Jonathan Hope and Pavithra Rajendran and Neil Sebire},
journal= {arXiv preprint arXiv:2604.04168},
year = {2026}
}
备注
36 pages, includes supplementary information