中文

探索多模态大语言模型用于放射学报告错误检查

计算与语言 2024-03-05 v2 计算机视觉与模式识别

摘要

本文提出多模态大语言模型(LLMs)作为放射科医师检查报告错误的助手的首批临床应用之一。从真实世界放射学数据集(包括 X 射线和 CT 扫描)创建评估数据集。通过引入三种类型错误(“插入”、“删除”和“替换”),修改原始报告子集以包含合成错误。评估包含两个难度级别:用于二元错误检查的 SIMPLE 和用于识别错误类型的 COMPLEX。在 SIMPLE 级别,微调模型在 MIMIC-CXR 和 IU X-ray 数据上分别显著提升 47.4% 和 25.4% 性能。在未见模态 CT 扫描中也观察到性能提升,模型比基线模型好 19.46%。在 MIMIC-CXR 数据集上,模型还以 1.67% 超越领域专家准确率。值得注意的是,在临床医师未得出正确结论的测试集子集(N=21)中,LLaVA 集成模式正确识别了 71.4% 的案例。然而,所有模型在识别错误类型方面表现不佳,凸显了 COMPLEX 级别的难度。该研究标志着利用多模态 LLMs 提高放射学诊断准确率的有希望的一步。集成模型表现出与临床医师相当的性能,甚至捕获了人类忽略的错误。

关键词

引用

@article{arxiv.2312.13103,
  title  = {Exploring Multimodal Large Language Models for Radiology Report Error-checking},
  author = {Jinge Wu and Yunsoo Kim and Eva C. Keller and Jamie Chow and Adam P. Levine and Nikolas Pontikos and Zina Ibrahim and Paul Taylor and Michelle C. Williams and Honghan Wu},
  journal= {arXiv preprint arXiv:2312.13103},
  year   = {2024}
}