中文

用于检测放射报告错误的生成式大语言模型

计算与语言 2025-04-08 v1 人工智能

摘要

在本retrospective研究中,构建了一个包含两个部分的数据集。第一部分包括1,656个由GPT-4使用指定提示生成的合成胸部放射报告,其中828个为无错误的合成报告,另828个包含错误。第二部分包括614个报告:307个来自MIMIC-CXR数据库(2011-2016年)的无错误报告,以及307个基于这些MIMIC-CXR报告和指定提示由GPT-4生成的含错误报告。所有错误均分为四类:否定、左/右、区间变化和转录错误。随后,对Llama-3、GPT-4和BiomedBERT等多个模型采用零样本提示、few-shot提示或微调策略进行优化。最后在构建的数据集上使用F1分数、95%置信区间(CI)和配对样本t检验评估这些模型的性能,预测结果还被放射科医生进一步评估。采用零样本提示时,微调后的Llama-3-70B-Instruct模型取得最佳性能,各项F1分数分别为否定错误0.769、左/右错误0.772、区间变化错误0.750、转录错误0.828,总体为0.780。在实际应用评估阶段,两位放射科医生审阅了200份由模型输出的随机抽取报告。其中99份被两位医生确认包含模型检测到的错误,163份被至少一位医生确认包含模型检测到的错误。经过MIMIC-CXR放射报告微调的生成式LLM显著提升了放射报告中的错误检测能力。

关键词

引用

@article{arxiv.2504.04336,
  title  = {Generative Large Language Models Trained for Detecting Errors in Radiology Reports},
  author = {Cong Sun and Kurt Teichman and Yiliang Zhou and Brian Critelli and David Nauheim and Graham Keir and Xindi Wang and Judy Zhong and Adam E Flanders and George Shih and Yifan Peng},
  journal= {arXiv preprint arXiv:2504.04336},
  year   = {2025}
}