M3CoTBench:医学图像理解中多模态大语言模型链律推理基准
图像与视频处理
2026-03-24 v3 计算机视觉与模式识别
摘要
链律推理 (Chain-of-Thought, CoT) 已证明在鼓励逐步中间推理方面对增强大型语言模型效果显著,近期研究亦将此范式扩展至多模态大语言模型 (MLLMs)。在医学领域,诊断决策依赖细微的视觉线索和顺序推理,CoT 与临床思维过程天然契合。然而,当前医学图像理解基准通常关注最终答案,忽略推理路径。此类不透明的推理过程缺乏可靠的判断依据,难以辅助医生诊断。为此,我们引入全新的M3CoTBench基准,专为评估医学图像理解中CoT推理的正确性、效率、影响力和一致性而设计。M3CoTBench包含:1)覆盖24种检查类型的多样化、多难度数据集,2)13种不同难度任务,3)为临床推理量身定制的CoT专用评估指标体系(正确性、效率、影响力和一致性),以及4)多个MLLMs的绩效分析。M3CoTBench系统性地评估了医学图像理解中CoT推理的多样化任务,揭示了当前MLLMs在生成可靠且临床可解释推理方面的局限性,旨在推动医疗领域透明、可信且具诊断准确性的人工智能系统的发展。项目页面可访问 https://juntaojianggavin.github.io/projects/M3CoTBench/。
引用
@article{arxiv.2601.08758,
title = {M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding},
author = {Juntao Jiang and Jiangning Zhang and Yali Bi and Jinsheng Bai and Weixuan Liu and Weiwei Jin and Zhucun Xue and Yong Liu and Xiaobin Hu and Shuicheng Yan},
journal= {arXiv preprint arXiv:2601.08758},
year = {2026}
}
备注
39 pages, 8 figures; accepted by ICLR 2026