超越诊断:评估多模态 LLM 在胸部 X 光片中的病灶定位能力
计算机视觉与模式识别
2025-11-20 v2 人工智能
摘要
最近的工作显示,前沿大型语言模型(LLM)及其多模态对等模型在医学测验和诊断任务中表现出色,凸显了其因易于访问、通用性强而在临床实践中具有广泛潜力。然而,超越诊断,医学图像解释的基本方面是能够定位病灶。评估定位不仅在临床和教育方面具有重要意义,还能为模型对解剖结构和疾病的空间理解提供洞见。本文系统评估了两种通用型 MLLM(GPT-4 和 GPT-5)以及一种领域特定模型(MedGemma)在胸部 X 光片上定位病灶的能力,通过一种将空间网格叠加于图像并召集坐标基于预测的提示流程。平均而言,在 CheXlocalize 数据集中的九种病灶中,GPT-5 的定位准确率为49.7%,随后是GPT-4(39.1%),MedGemma(17.7%),所有模型的准确率均低于面向特定任务的 CNN 基线(59.9%)和放射科医生基准(80.1%)。尽管性能适中,错误分析显示,GPT-5 的预测大多位于解剖上可信的区域,只是定位不够精确。GPT-4 在解剖位置固定的病灶上表现良好,但在空间可变发现时表现不佳,且更频繁地出现解剖上不合理的预测。MedGemma 在所有病灶上表现最差,但在提供示例通过few shot提示后显示出改进。我们的发现凸显了当前 MLLM 在医学影像中的潜力与局限性,强调了将其与特定任务工具集成以实现可靠使用的重要性。
引用
@article{arxiv.2509.18015,
title = {Beyond Diagnosis: Evaluating Multimodal LLMs for Pathology Localization in Chest Radiographs},
author = {Advait Gosai and Arun Kavishwar and Stephanie L. McNamara and Soujanya Samineni and Renato Umeton and Alexander Chowdhury and William Lotter},
journal= {arXiv preprint arXiv:2509.18015},
year = {2025}
}
备注
Proceedings of the 5th Machine Learning for Health (ML4H) Symposium