中文

MedRCube:用于医学影像中 MLLMs 精细深入评估的多维框架

计算与语言 2026-04-16 v1 计算机视觉与模式识别

摘要

多模态大语言模型(MLLMs)在医学影像领域的潜力提升了系统且严谨评估框架的需求,这些框架需与实际医学影像实践相吻合。现有做法仅报告单一或粗糙的指标,缺乏专门临床支持所需的细粒度,无法评估推理机制的可靠性。为此,我们提出一种向多维、细粒度和深入评估范式的转变。基于为此范式设计的两阶段系统构建管道,我们以 MedRCube 实例化。我们对 33 个 MLLMs 进行基准测试,Lingshu-32B 取得领先表现。关键在于,MedRCube 揭示了在先前评估设置下无法察觉的若干显著洞见。此外,我们引入了可信度评估子集,用于量化推理可信度,发现捷径行为与诊断任务性能高度显著正相关,这对临床可信部署提出了警惕。本工作的资源可在 https://github.com/F1mc/MedRCube 查阅。

关键词

引用

@article{arxiv.2604.13756,
  title  = {MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging},
  author = {Zhijie Bao and Fangke Chen and Licheng Bao and Chenhui Zhang and Wei Chen and Jiajie Peng and Zhongyu Wei},
  journal= {arXiv preprint arXiv:2604.13756},
  year   = {2026}
}