微调内部大型语言模型以从放射科报告推断差别诊断
计算与语言
2024-10-15 v1
摘要
放射科报告总结关键发现和从医学影像检查中推断的差别诊断。从报告中提取差别诊断对于包括患者管理和治疗计划在内的下游任务至关重要。然而,这些报告的非结构化特性,表现为多样化的语言风格和不一致的格式,带来了重大挑战。虽然专有大型语言模型 (LLM) 如 GPT-4 能有效检索临床信息,但其实际应用受限于高成本和对受保护健康信息 (PHI) 的隐私问题。本研究介绍了一个开发针对从放射科报告中识别差别诊断的内部 LLM 的管道。我们首先利用 GPT-4 创建 31,056 篇标记报告,然后使用此数据集对开源 LLM 进行微调。在一组由临床医生标注的 1,067 篇报告上进行评估,所提出的模型实现了 92.1% 的平均 F1 分数,与 GPT-4 (90.8%) 持平。通过本研究,我们提供了构建内部 LLM 的方法论:匹配 GPT 的性能,减少对昂贵专有模型的依赖,并增强受保护健康信息的隐私和安全性。
引用
@article{arxiv.2410.09234,
title = {Fine-Tuning In-House Large Language Models to Infer Differential Diagnosis from Radiology Reports},
author = {Luoyao Chen and Revant Teotia and Antonio Verdone and Aidan Cardall and Lakshay Tyagi and Yiqiu Shen and Sumit Chopra},
journal= {arXiv preprint arXiv:2410.09234},
year = {2024}
}
备注
10 pages, 2 figures, 4 tables