中文

多模态 LLM 对 CT 扫描的解读能力如何?一种用于分析的自动评估框架

人工智能 2024-06-19 v2 计算与语言 计算机视觉与模式识别

摘要

自动解读 CT 扫描可以减轻放射科医生的工作负担。然而,这主要由于缺乏充足的数据集和评估参考标准而面临挑战。本研究旨在通过引入一种名为“GPTRadScore”的新型评估框架来弥合这一差距。该框架评估多模态 LLM(如 GPT-4 with Vision (GPT-4V)、Gemini Pro Vision、LLaVA-Med 和 RadFM)在为前瞻性识别的发现生成描述方面的能力。通过采用基于 GPT-4 的分解技术,GPTRadScore 将这些生成的描述与金标准报告句子进行比较,分析它们在身体部位、位置和发现类型方面的准确性。评估结果表明其与临床医生评估具有高度相关性,并突显了其相对于 BLEU、METEOR 和 ROUGE 等传统指标的潜力。此外,为了对未来研究做出贡献,我们计划发布一个由临床医生标注的基准数据集。使用 GPTRadScore,我们发现虽然 GPT-4V 和 Gemini Pro Vision 表现较好,但其表现仍显示出巨大的改进空间,主要原因是用于训练这些模型的数据集存在局限性。为了证明这一潜力,我们对 RadFM 进行了微调,结果带来了显著的准确性提升:位置准确率从 3.41% 提升至 12.8%,身体部位准确率从 29.12% 提升至 53%,类型准确率从 9.24% 提升至 30%,从而验证了我们的假设。

关键词

引用

@article{arxiv.2403.05680,
  title  = {How Well Do Multi-modal LLMs Interpret CT Scans? An Auto-Evaluation Framework for Analyses},
  author = {Qingqing Zhu and Benjamin Hou and Tejas S. Mathai and Pritam Mukherjee and Qiao Jin and Xiuying Chen and Zhizheng Wang and Ruida Cheng and Ronald M. Summers and Zhiyong Lu},
  journal= {arXiv preprint arXiv:2403.05680},
  year   = {2024}
}