MedQ-Deg:面向医学图像质量退化的多维 MLLM 评估基准
计算机视觉与模式识别
2026-03-10 v1
摘要
尽管多模态大语言模型 (MLLMs) 在标准基准测试上表现卓越,但在实际临床环境中面临严峻挑战,因为医学图像不可避免地会遭受各种质量退化。现有基准存在两个关键局限性:(1)缺乏跨医学图像质量梯度的大规模、多维评估;(2)没有系统的置信度校准分析。为此,我们提出了 MedQ-Deg,一个用于评估医学 MLLMs 在图像质量退化下的综合基准。MedQ-Deg 提供了横跨 18 种不同退化类型的、30 个细粒度能力维度以及 7 种成像模态的多维评估,包含 24,894 对问答对。每种退化均在 3 个严重程度等级上实现,并由专职放射科医生校准。我们进一步引入 Calibration Shift 指标,用于量化模型感知置信度与实际性能之间的差距,以评估退化情境下的元认知可靠性。我们对 40 款主流 MLLMs 进行全面评估,揭示了若干关键发现:(1)整体模型性能随退化严重程度的增加而系统性下降;(2)模型普遍表现出 AI Dunning-Kruger 效应,即便在严重的准确性崩溃时仍保持不当的高置信度;(3)模型在能力维度、成像模态和退化类型之间显示出显著的行为差异。我们希望 MedQ-Deg 能推动医学 MLLMs 在实际临床实践中具备鲁棒性和可信度的进程。
引用
@article{arxiv.2603.07769,
title = {MedQ-Deg: A Multidimensional Benchmark for Evaluating MLLMs Across Medical Image Quality Degradations},
author = {Jiyao Liu and Junzhi Ning and Chenglong Ma and Wanying Qu and Jianghan Shen and Siqi Luo and Jinjie Wei and Jin Ye and Pengze Li and Tianbin Li and Jiashi Lin and Hongming Shan and Xinzhe Luo and Xiaohong Liu and Lihao Liu and Junjun He and Ningsheng Xu},
journal= {arXiv preprint arXiv:2603.07769},
year = {2026}
}
备注
29 pages, 11 figures