中文

面向入院诊断的多模态LLM评估:真实世界性能、安全性与成本

机器学习 2026-04-21 v1 人工智能

摘要

背景:大型语言模型(LLM)越来越被用于诊断支持,但很少有评估在真实世界的多模态入院数据上进行,尤其是来自中低收入国家(LMIC)公共医院。方法:我们进行了VALID研究,对来自南非某三级公共医院的539个多模态入院病例进行回顾性评估。输入包括放射学影像(CT、MRI、CXR)和报告、实验室结果、临床记录和生命体征。专家小组裁决了300个病例(平衡且不一致的子集),以确立诊断、鉴别诊断和推理的真实答案。十个多模态LLM以零样本方式生成输出。一个经过校准的三模型LLM评审对所有输出和常规病房诊断进行评分,涵盖诊断准确性、鉴别诊断质量、推理和患者安全性(超过10,000次评估)。主要结果是复合得分(S3S_3S4S_4)和获胜率。结果:(i)LLM表现紧密集中(<15%变异),尽管成本差异很大;低成本模型的表现与顶级模型相当。(ii)所有LLM在诊断和安全性得分上均显著优于常规病房诊断。(iii)最佳表现由GPT-5.1取得,其后是Gemini模型。(iv)加入放射学报告可提升6%的表现。(v)诊断和推理得分高度相关(ρ=0.85\rho = 0.85)。(vi)输出率变化(65%-100%),由于输入限制。结果在各子集和评估设计中均稳健。结论:在真实世界的LMIC数据集上,多模态LLM尽管成本差异很大,显示出相似的诊断性能,并在平均安全性指标上优于常规护理。在LMIC环境下,可负担性、稳健性和部署限制可能超过细微的性能差异。

关键词

引用

@article{arxiv.2604.16980,
  title  = {Evaluating Multimodal LLMs for Inpatient Diagnosis: Real-World Performance, Safety, and Cost Across Ten Frontier Models},
  author = {Bruce A. Bassett and Amy Rouillard and Sitwala Mundia and Michael Cameron Gramanie and Linda Camara and Ziyaad Dangor and Shabir A. Madhi and Kajal Morar and Marlvin T. Ncube and Ismail Kalla and Haroon Saloojee},
  journal= {arXiv preprint arXiv:2604.16980},
  year   = {2026}
}

备注

17 pages, 11 figures, 10 tables