结构化放射学报告:以轻量级模型挑战 LLMs
计算与语言
2025-07-15 v2 机器学习
摘要
放射学报告对临床决策至关重要,但往往缺乏标准化格式,这限制了人类的可解释性和机器学习(ML)应用。尽管大型语言模型在重新格式化临床文本方面展现出了强大的能力,但其高昂的计算需求、缺乏透明度以及数据隐私问题阻碍了其实际部署。为了应对这些挑战,我们探索了轻量级编码器-解码器模型(<300M 参数)——特别是 T5 和 BERT2BERT——用于从 MIMIC-CXR 和 CheXpert Plus 数据集中结构化放射学报告。我们将这些模型与八个开源 LLMs(1B-70B)进行了基准比较,这些 LLMs 通过前缀提示、上下文学习(ICL)和低秩自适应(LoRA)微调进行适配。我们表现最佳的轻量级模型在人工标注的测试集上优于所有基于提示技术适配的 LLMs。尽管一些经过 LoRA 微调的 LLMs 在 Findings 部分取得了优于轻量级模型的微小提升(BLEU 6.4%,ROUGE-L 4.8%,BERTScore 3.6%,F1-RadGraph 1.1%,GREEN 3.6%,以及 F1-SRR-BERT 4.3%),但这些改进是以大幅增加的计算资源为代价的。例如,与轻量级模型相比,LLaMA-3-70B 的推理时间、成本和碳排放量是其 400 倍以上。这些结果突显了轻量级、任务特定模型作为资源受限医疗环境中结构化临床文本的可持续且保护隐私的解决方案的潜力。
引用
@article{arxiv.2506.00200,
title = {Structuring Radiology Reports: Challenging LLMs with Lightweight Models},
author = {Johannes Moll and Louisa Fay and Asfandyar Azhar and Sophie Ostmeier and Tim Lueth and Sergios Gatidis and Curtis Langlotz and Jean-Benoit Delbrouck},
journal= {arXiv preprint arXiv:2506.00200},
year = {2025}
}