中文

MMRareBench:一个罕见病多模态多图像医学基准

计算机视觉与模式识别 2026-05-14 v2

摘要

多模态大语言模型(MLLMs)在常见疾病的临床任务上取得了进展,但它们在罕见病上的表现尚未得到充分检验。在罕见病场景中,临床医生通常缺乏先验临床知识,迫使他们严格依赖病例层面的证据进行临床判断。现有基准主要评估常见病、单图像的设置,使得在罕见病数据稀缺的情况下,多模态和多图像证据的整合能力未被系统评估。我们引入了 MMRareBench,据我们所知,这是首个在四个符合工作流程的赛道(诊断、治疗计划、跨图像证据对齐和检查建议)上联合评估多模态和多图像临床能力的罕见病基准。该基准包含 1756 个问答对和 7958 张相关医学图像,这些数据来自 PMC 病例报告,并具有 Orphanet 锚定的本体对齐、赛道特定的泄漏控制、基于证据的标注以及两级评估协议。对 23 个 MLLM 的系统评估揭示了碎片化的能力画像和普遍较低的治疗计划性能,尽管医学领域模型在诊断分数上具有竞争力,但在多图像赛道上却大幅落后于通用 MLLM。这些模式与能力稀释效应一致:医学微调可以缩小诊断差距,但可能侵蚀罕见病证据整合所需的组合式多图像能力。

关键词

引用

@article{arxiv.2604.10755,
  title  = {MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark},
  author = {Junzhi Ning and Jiashi Lin and Yingying Fang and Wei Li and Jiyao Liu and Cheng Tang and Chenglong Ma and Wenhao Tang and Tianbin Li and Ziyan Huang and Guang Yang and Junjun He},
  journal= {arXiv preprint arXiv:2604.10755},
  year   = {2026}
}