中文

MedQ-Bench:评估医学图像质量评估能力的 MLLM 基准

计算机视觉与模式识别 2025-10-03 v1

摘要

医学图像质量评估(IQA)作为临床 AI 的一线安全门禁,现有方法受限于标量评分指标,无法反映专家评估中核心的描述性、类人推理过程。为填补这一空白,我们提出 MedQ-Bench—a 全面的基准,确立了面向多模态大语言模型(MLLMs)的语言化医学图像质量评估的感知-推理范式。MedQ-Bench 定义两项互补任务:(1)MedQ-感知,通过人类精选的问题检验低级感知能力;(2)MedQ-推理,涵盖无参考和比较推理任务,使模型评估与人类对图像质量的推理一致。该基准覆盖五种成像模态和超过四十种质量属性,总计 2600 项感知查询和 708 项推理评估,涵盖多样化图像来源,包括真实临床获取的图像、通过物理基重建模拟退化的图像,以及 AI 生成的图像。为评估推理能力,我们提出多维度评判方案,对模型输出沿四个互补维度进行评估。我们进一步通过将 LLM 基于评判与放射科学家进行严格的人类-AI 对齐验证。我们评估了 14 种最先进的 MLLMs,结果显示模型展现出初步但不稳定的感知和推理能力,准确率不足以支撑可靠的临床应用。这些发现凸显了在医学 IQA 中针对性优化 MLLMs 的必要性。我们期望 MedQ-Bench 将催化进一步的探索,释放 MLLMs 在医学图像质量评估中的潜在能力。

关键词

引用

@article{arxiv.2510.01691,
  title  = {MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs},
  author = {Jiyao Liu and Jinjie Wei and Wanying Qu and Chenglong Ma and Junzhi Ning and Yunheng Li and Ying Chen and Xinzhe Luo and Pengcheng Chen and Xin Gao and Ming Hu and Huihui Xu and Xin Wang and Shujian Gao and Dingkang Yang and Zhongying Deng and Jin Ye and Lihao Liu and Junjun He and Ningsheng Xu},
  journal= {arXiv preprint arXiv:2510.01691},
  year   = {2025}
}

备注

26 pages, 13 figures