评估大型语言模型在肺栓塞登记簿中的自动临床抽象能力:跨模型规模、版本与参数的性能
计算与语言
2025-08-13 v3
摘要
肺栓塞(PE)登记簿加速实践改进研究,但依赖资源密集的放射学报告的手动抽象。我们评估了公开的大型语言模型(LLM)是否可以在不牺牲数据质量的前提下自动从计算断层扫描 PE(CTPE)报告中实现概念抽取。测试了四个 Llama-3(L3)变体(3.0 8 B、3.1 8 B、3.1 70 B、3.3 70 B)和两个审阅模型 Phi-4(P4)14 B 和 Gemma-3 27 B(G3),每种模型各自在来自 MIMIC-IV 和 Duke University 的 250 份双注释 CTPE 报告中进行测试。结果包括准确率、阳性预测值(PPV)和阴性预测值(NPV),相对于人类金标准,跨模型规模、温度设置和 shot 计数进行比较。所有概念的平均准确率随规模而提高:0.83(L3-0 8 B)、0.91(L3-1 8 B),以及两款 70 B 变体达到 0.96;P4 14 B 实现 0.98;G3 匹配。准确率在数据集之间相差不足 0.03,凸显外部鲁棒性。在双模型一致性分析(L3 70 B + P4 14 B)中,PE-存在 PPV 大于等于 0.95,NPV 大于等于 0.98,而位置、血栓负荷、右心受累和图像质量伪影每个均保持 PPV 大于等于 0.90,NPV 大于等于 0.95。少于 4% 的单个概念注释不一致,超过 75% 的报告实现完全一致。G3 表现相当。因此,LLM 为 PE 登记簿的抽象提供了可扩展且准确的解决方案,双模型审阅工作流程可在最小的人类监督下进一步保障数据质量。
引用
@article{arxiv.2503.21004,
title = {Evaluating Large Language Models for Automated Clinical Abstraction in Pulmonary Embolism Registries: Performance Across Model Sizes, Versions, and Parameters},
author = {Mahmoud Alwakeel and Emory Buck and Jonathan G. Martin and Imran Aslam and Sudarshan Rajagopal and Jian Pei and Mihai V. Podgoreanu and Christopher J. Lindsell and An-Kwok Ian Wong},
journal= {arXiv preprint arXiv:2503.21004},
year = {2025}
}