中文

开源视觉语言模型在多样医学影像任务上的诊断准确性评估

图像与视频处理 2025-08-05 v1 计算机视觉与模式识别

摘要

本回顾性研究评估了五个视觉语言模型(Qwen2.5、Phi-4、Gemma3、Llama3.2 和 Mistral3.1)在 MedFMC 数据集上的诊断准确性。该数据集包含来自 7,461 名患者的 22,349 张影像,涵盖胸部 X 光片(19 种疾病多标签分类)、结肠病理(肿瘤检测)、内窥镜(结肠病灶识别)、新生儿黄疸评估(基于皮肤颜色决定治疗必要性)以及视网膜 Fundus 照影(5 分级糖尿病视网膜病变)。在三个实验设置下进行诊断准确性比较:视觉输入、多模态输入和链路思考推理。模型准确性以真实标签为基准进行评估,使用自助置信区间进行统计比较(p<.05)。Qwen2.5 在胸部 X 光片(90.4%)和内窥镜图像(84.2%)上取得最高准确性,显著优于其他模型(p<.001)。结肠病理学中,Qwen2.5(69.0%)和 Phi-4(69.6%)表现相当(p=.41),但均显著优于其他 VLM(p<.001)。在新生儿黄疸评估方面,Qwen2.5(58.3%)和 Phi-4(58.1%)显示出相当的领先准确性(p=.93),显著优于其它模型(p<.001)。所有模型在视网膜 Fundus 照影方面表现不佳;Qwen2.5 和 Gemma3 虽取得最高但有限的准确性(18.6%),且与其他模型相比仍显著更好(p<.001)。意外的是,部分模型和模态上多模态输入反而降低了准确性,链路思考推理提示也未能提升准确性。开源 VLM 在胸部 X 光片解读方面展现出有前景的诊断能力,但在视网膜 Fundus 照影等复杂领域表现有限,这凸显了在广泛临床应用前需要进一步发展和针对性适配。

关键词

引用

@article{arxiv.2508.01016,
  title  = {Diagnostic Accuracy of Open-Source Vision-Language Models on Diverse Medical Imaging Tasks},
  author = {Gustav Müller-Franzes and Debora Jutz and Jakob Nikolas Kather and Christiane Kuhl and Sven Nebelung and Daniel Truhn},
  journal= {arXiv preprint arXiv:2508.01016},
  year   = {2025}
}