GPT-5 在多模态医学推理中的能力
计算与语言
2025-08-14 v2 人工智能
摘要
最近的大型语言模型(LLM)进展使得通用系统能够在无需大量微调的情况下执行越来越复杂的领域特定推理。在医学领域,决策往往需要整合来自不同来源的异构信息,包括患者叙述、结构化数据和医学图像。本研究将 GPT-5 定位为医学决策支持的通用多模态推理器,系统评估其在统一协议下的零样链路思考推理性能,涵盖基于文本的问答任务和视觉问答任务。我们将 GPT-5、GPT-5-mini、GPT-5-nano 和 GPT-4o-2024-11-20 对照测试于 MedQA、MedXpertQA(文本和多模态)、MMLU 医学子集、USMLE 自学考试以及 VQA-RAD 标准划分。结果表明,GPT-5 在所有 QA 基准测试中均实现统一 baselines 之上的最高准确率,在多模态推理方面实现显著提升。在 MedXpertQA MM 上,GPT-5 在推理和理解分数上分别相对于 GPT-4o 提升了 +29.26% 和 +26.18%,并在推理和理解方面分别超越了经认证的人类专家 +24.23% 和 +29.40%。相比之下,GPT-4o 在大多数维度上仍低于人类专家水平。一个代表性案例研究展示了 GPT-5 将视觉和文本线索整合为连贯诊断推理链的能力,为合适的高风险干预措施提供建议。我们的结果表明,在这些受控的多模态推理基准测试中,GPT-5 已从人类可比水平提升至超越人类专家水平。这一改进可能实质性地影响未来临床决策支持系统的设计。
引用
@article{arxiv.2508.08224,
title = {Capabilities of GPT-5 on Multimodal Medical Reasoning},
author = {Shansong Wang and Mingzhe Hu and Qiang Li and Mojtaba Safari and Xiaofeng Yang},
journal= {arXiv preprint arXiv:2508.08224},
year = {2025}
}
备注
Corrected some typos