中文

通用大型语言模型在医学基准测试中超越临床工具

计算与语言 2025-12-02 v1

摘要

专业临床 AI 助手正快速进入医疗实践,常被宣传为比通用大型语言模型(LLM)更安全可靠。然而,与前沿模型不同,这些临床工具很少受到独立、量化的评估,尽管对诊断、分流和指南解读产生越来越大的影响,却存在关键证据缺口。我们评估了两款广泛部署的临床 AI 系统(OpenEvidence 和 UpToDate Expert AI),并将其与三款最先进的通用 LLM(GPT-5、Gemini 3 Pro 和 Claude Sonnet 4.5)进行比较,使用包含 1000 项任务的 mini-benchmark,涵盖 MedQA(医学知识)和 HealthBench(医生对齐)任务。通用模型始终优于临床工具,GPT-5 取得最高分数,而 OpenEvidence 和 UpToDate 在完整性、沟通质量、情境感知和系统性安全推理方面均表现不足。这些发现表明,标记为临床决策支持工具的产品可能常常落后于前沿 LLM,凸显在患者导向工作流程中部署前需进行透明、独立评估的紧迫需求。

关键词

引用

@article{arxiv.2512.01191,
  title  = {Generalist Large Language Models Outperform Clinical Tools on Medical Benchmarks},
  author = {Krithik Vishwanath and Mrigayu Ghosh and Anton Alyakin and Daniel Alexander Alber and Yindalon Aphinyanaphongs and Eric Karl Oermann},
  journal= {arXiv preprint arXiv:2512.01191},
  year   = {2025}
}

备注

17 pages, 4 figures (2 regular, 2 supplemental)