中文

GPT-4V 尚未能生成放射科报告

计算机与社会 2024-11-18 v4 人工智能 计算与语言

摘要

GPT-4V 声称拥有强大的多模态能力,引发了将其用于自动化放射科报告编写的兴趣,但缺乏彻底的评估。在本工作中,我们对 GPT-4V 在生成放射科报告方面的能力进行系统评估,分别使用两组胸部X光报告数据集:MIMIC-CXR 和 IU X-Ray。我们尝试通过不同的提示策略直接生成报告,发现其在词汇指标和临床有效性指标上均表现极差。为理解低性能, 我们将任务分解为两个步骤:1)从图像预测医学条件标签的医学图像推理步骤;2)从(groundtruth)条件生成报告的报告合成步骤。我们表明,GPT-4V 在图像推理方面的表现在不同提示策略下均始终较差。事实上,无论图像上存在哪些groundtruth条件,模型预测标签的分布都保持不变,这表明该模型在解释胸部X光方面并未真正理解。即使在报告合成步骤中给出groundtruth条件,其生成的报告在正确性和自然性方面都不如微调后的 LLaMA-2。总体而言,我们的发现对将 GPT-4V 用于放射科工作流程的可行性提出了怀疑。

关键词

引用

@article{arxiv.2407.12176,
  title  = {GPT-4V Cannot Generate Radiology Reports Yet},
  author = {Yuyang Jiang and Chacha Chen and Dang Nguyen and Benjamin M. Mervak and Chenhao Tan},
  journal= {arXiv preprint arXiv:2407.12176},
  year   = {2024}
}

备注

24 pages, 3 figures, code: https://github.com/ChicagoHAI/cxr-eval-gpt-4v Findings paper presented at Machine Learning for Health (ML4H) symposium 2024, December 15-16, 2024, Vancouver, Canada, 26 pages