评估大语言模型在跨器官系统 CT 放射学报告零样本疾病标注中的应用
计算与语言
2026-01-09 v2
摘要
目的:本研究旨在评估大语言模型(LLMs)在自动化 CT 放射学报告疾病标注中的有效性。我们比较了基于规则的算法(RBA)、RadBERT 以及三个轻量级开放权重 LLMs,用于对胸部、腹部和盆腔(CAP)CT 报告进行多疾病标注。材料与方法:这项回顾性研究分析了来自 29,540 名患者的 40,833 份胸腹盆腔(CAP)CT 报告,其中 1,789 份报告跨三个器官系统进行了人工标注。使用 CT RATE 数据集进行了外部验证。测试了三个开放权重 LLMs 并采用零样本提示。使用 Cohen's Kappa()和微平均/宏平均 F1 分数评估性能。结果:在包含 8,854 名患者的 12,197 份 CAP 报告的内部测试集中,Llama-3.1 8B 和 Gemma-3 27B 表现出最高的一致性( 中位数:0.87)。在人工标注集上,Gemma-3 27B 取得了最高的宏 F1(0.82),其次是 Llama-3.1 8B(0.79),而 RBA 得分最低(0.64)。在 CT RATE 数据集上(仅限肺部/胸膜标签),Llama-3.1 8B 表现最好(0.91),Gemma-3 27B 紧随其后(0.89)。性能差异主要归因于不同的标注实践,特别是对于肺不张等主观性高的标签。结论:轻量级 LLMs 在 CT 报告标注方面优于基于规则的方法,并能通过零样本提示泛化至不同器官系统。然而,仅靠二元标签无法捕捉报告语言的全部细微差别。LLMs 可以提供符合临床判断和用户需求的灵活、高效的解决方案。
引用
@article{arxiv.2506.03259,
title = {Evaluating Large Language Models for Zero-Shot Disease Labeling in CT Radiology Reports Across Organ Systems},
author = {Michael E. Garcia-Alcoser and Mobina GhojoghNejad and Fakrul Islam Tushar and David Kim and Kyle J. Lafata and Geoffrey D. Rubin and Joseph Y. Lo},
journal= {arXiv preprint arXiv:2506.03259},
year = {2026}
}
备注
18 pages, 9 figures, to be submitted in Radiology: Artificial Intelligence