中文

多模态大语言模型在临床皮肤科中是否就绪?一种真实世界评估

计算机视觉与模式识别 2026-05-07 v1 人工智能 计算机与社会

摘要

多模态大语言模型(MLLM)在公开可用的皮肤科基准测试上已显示出前景,但基准性能是否能在真实世界的皮肤科决策中推广仍不明确。为量化此基准与临床决策之间的差距,我们评估了四个开源权重 MLLM(InternVL-Chat v1.5、LLaVA-Med v1.5、SkinGPT4 和 MedGemma-4B-Instruct)以及一个商业 MLLM(GPT-4.1),在三个公开皮肤科数据集和一个由 5,811 例病例和 46,405 张临床图像组成的回顾性多中心医院皮肤科咨询队列中进行测试。模型在两种临床相关任务上的表现:差异诊断生成和基于严重程度的分诊。公开数据集上的诊断性能平平,在真实世界队列中表现更差。在公开基准测试上,最佳开源模型的 Top-3 诊断准确率达到 26.55%,GPT-4.1 为 42.25%。在真实世界咨询病例中仅使用图像时,开源模型的 Top-3 诊断准确率下降至 1.50%—13.35%,GPT-4.1 为 24.65%。纳入临床背景信息后,所有模型的表现均得到改善,开源模型的 Top-3 诊断准确率提升至最高 28.75%,GPT-4.1 为 38.93%。然而,模型输出对不完整或错误的咨询背景信息高度敏感。在基于严重程度的分诊任务中,模型实现了中等灵敏度(超过 60%),表明其在筛查方面具有潜在实用性,但不足以用于临床部署。这些发现表明,当前皮肤科 MLLM 的基准性能显著高估了其在真实世界临床中的能力。

关键词

引用

@article{arxiv.2605.04098,
  title  = {Are Multimodal LLMs Ready for Clinical Dermatology? A Real-World Evaluation in Dermatology},
  author = {Roy Jiang and Hyunjae Kim and Zhenyue Qin and Morten Lee and Margaret MacGibeny and Ailish Hanly and Angela Sadlowski and Shanin Chowdhury and Xuguang Ai and Jeffrey Gehlhausen and Qingyu Chen},
  journal= {arXiv preprint arXiv:2605.04098},
  year   = {2026}
}