MedGemma 与 GPT-4:开源与专有模型的零样本医学疾病图像分类
计算机视觉与模式识别
2026-04-20 v1 人工智能
摘要
多模态大语言模型 (LLM) 引入了医学影像的新兴范式,通过广泛的临床知识解读扫描图像,为疾病分类提供了变革性方法。本研究对比了两种截然不同的 AI 架构:针对六种不同疾病诊断的专用开源智能体 MedGemma 与专有大型多模态模型 GPT-4。经使用低秩适应 (LoRA) 微调的 MedGemma-4b-it 模型,在疾病分类任务中实现了平均测试准确率 80.37%,显著高于未微调的 GPT-4 的 69.58%。此外,MedGemma 在高风险临床任务(如癌症和肺炎检测)中表现出更高的灵敏度。通过混淆矩阵和分类报告进行的定量分析,为模型在所有类别中的性能提供了全面见解。这些结果强调,针对临床实施的领域特定微调对于最小化幻觉至关重要,使 MedGemma 成为复杂、基于证据的医学推理的精明工具。
引用
@article{arxiv.2512.23304,
title = {MedGemma vs GPT-4: Open-Source and Proprietary Zero-shot Medical Disease Classification from Images},
author = {Md. Sazzadul Islam Prottasha and Nabil Walid Rafi},
journal= {arXiv preprint arXiv:2512.23304},
year = {2026}
}
备注
Accepted for publication in the Journal of Machine Learning and Deep Learning (JMLDL). 9 pages, 9 figures, 10 tables