评估GPT-5作为多模态临床推理模型:一篇景观评论
计算机视觉与模式识别
2026-03-06 v1 人工智能
机器学习
摘要
从任务特定人工智能向通用性基础模型的转变引发了关于其在临床医学中集成推理能力的根本性问题。临床诊断需要综合不明确的患者叙述、实验室数据和多模态影像。本篇景观评论提供了对GPT-5系列(GPT-5、GPT-5 Mini、GPT-5 Nano)进行首次受控、横断面评估的分析,评估对象包括其前身GPT-4o,以及涵盖医学教育考试、基于文本的推理基准测试,以及神经放射学、数字病理学和乳腺影像学中的视觉问答任务。采用标准化的零样本链式思考协议进行测试。GPT-5在专家水平的文本推理方面取得了显著进步,在MedXpertQA上实现了超过25个百分点的绝对提升。当被要求进行多模态综合时,GPT-5有效地利用了这一增强的推理能力,将不确定的临床叙述锚定在具体的影像证据上,在大多数视觉问答基准测试中实现了最先进或具竞争力的性能,并在需要精细病灶特征表征的乳腺影像学任务中超越GPT-4o 10-40%的提升幅度。然而,在神经放射学中性能仍属中等(44%宏平均准确率),在乳腺影像学任务中也落后于领域特定模型(专用系统准确率超过80%,而GPT-5仅为52-64%)。这些发现表明,尽管GPT-5代表了向集成多模态临床推理方向的实质性进步,模仿医生通过客观发现偏向不确定信息的认知过程,但通用模型尚不能替代在高度专业化、感知关键任务中专为构建的系统。
引用
@article{arxiv.2603.04763,
title = {Evaluating GPT-5 as a Multimodal Clinical Reasoner: A Landscape Commentary},
author = {Alexandru Florea and Shansong Wang and Mingzhe Hu and Qiang Li and Zach Eidex and Luke del Balzo and Mojtaba Safari and Xiaofeng Yang},
journal= {arXiv preprint arXiv:2603.04763},
year = {2026}
}