评估多模态大语言模型在临床任务中的思考模式基准
计算与语言
2025-11-06 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
多模态大语言模型(MLLM)研究的最新进展之一是“具有显式控制其内部思考过程(通常称为“思考模式”)的”推理型MLLM“的出现,这些模型还提供标准的“非思考模式”。这种能力允许这些模型在生成最终响应之前进行逐步的内部 deliberation。随着这些“双状态”MLLM的快速过渡到并采纳,我们严格评估了这些 MLLM 的增强推理过程对临床任务中模型性能和可靠性的影响。本文评估了两家领先的 MLLM,Seed1.5-VL 和 Gemini-2.5-Flash,的主动“思考模式”能力用于医疗应用。我们使用 VQA-RAD 和 ROCOv2 数据集对其在四个视觉医学任务上的性能进行评估。我们的发现表明,对于大多数任务而言,激活思考模式后的提升仍与标准非思考模式相比有限。他们在诸如开放式 VQA 和医学图像解释等复杂医学任务上的表现仍不理想,这凸显了针对医疗领域的数据和更先进方法在医学知识集成方面的需求。
引用
@article{arxiv.2511.03328,
title = {Benchmarking the Thinking Mode of Multimodal Large Language Models in Clinical Tasks},
author = {Jindong Hong and Tianjie Chen and Lingjie Luo and Chuanyang Zheng and Ting Xu and Haibao Yu and Jianing Qiu and Qianzhong Chen and Suning Huang and Yan Xu and Yong Gui and Yijun He and Jiankai Sun},
journal= {arXiv preprint arXiv:2511.03328},
year = {2025}
}