中文

Med-CMR:整合视觉证据与临床逻辑的医学复杂多模态推理细粒度基准

人工智能 2026-04-01 v2 计算机视觉与模式识别

摘要

MLLM 正在临床工作流程中出现,但其执行复杂医学推理的能力尚不清楚。我们提出 Med-CMR,一个医学复杂多模态推理细粒度基准。Med-CMR 与现有方法的区别在于三个核心特征:1)系统化的能力分解,将医学多模态推理细分为细粒度视觉理解和多步骤推理,以实现针对性评估;2)具有挑战性的任务设计,视觉理解涵盖三个关键维度(小目标检测、细节辨识、空间理解),推理覆盖四个临床相关场景(时间预测、因果推理、长尾泛化、多源集成);3)广泛且高质量的数据覆盖,包含 20,653 对视觉问答 (VQA) 对,涵盖 11 个器官系统和 12 种影像模态,经严格的两阶段(专家人工 + 模型辅助)审核,确保临床真实性。我们对 18 个最先进的 MLLMs 进行 Med-CMR 评估,发现 GPT-5 成为表现最好的商业模型:在多选题上的准确率为 57.81%,开放式得分达 48.70 分,超越 Gemini 2.5 Pro(49.87% 准确率,45.98 分)和领先的开源模型 Qwen3-VL-235B-A22B(49.34% 准确率,42.62 分)。然而,专业医学 MLLM 并不一定能稍微优于强大的通用模型,长尾泛化成为主要的失败模式。Med-CMR 因此为视觉-推理集成和罕见案例鲁棒性提供了压力测试,以及面向未来临床系统的严格基准。

关键词

引用

@article{arxiv.2512.00818,
  title  = {Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning},
  author = {Haozhen Gong and Xiaozhong Ji and Yuansen Liu and Wenbin Wu and Xiaoxiao Yan and Jingjing Liu and Kai Wu and Jiazhen Pan and Bailiang Jian and Jiangning Zhang and Xiaobin Hu and Hongwei Bran Li},
  journal= {arXiv preprint arXiv:2512.00818},
  year   = {2026}
}