中文

MedVLThinker:多模态医学推理的简单基线

计算机视觉与模式识别 2026-02-19 v3

摘要

大型推理模型 (LRM) 通过链式思考推理启用模型“在作答前思考”,这在 AI 中引入了新范式。然而,缺乏用于构建以推理为中心的医学 LMM 的开放且可复现的配方,阻碍了社区范围的研究、分析和比较。本文提出 MedVLThinker,一个包含简单而强大的基线套件。我们的完全开放配方包括:(1) 针对文本-only 和图像-文本医学数据的系统化数据精选,根据推理难度进行筛选;(2) 两种训练范式:基于蒸馏推理痕迹的监督微调 (SFT) 以及基于最终答案正确性的强化学习可验证奖励 (RLVR)。在针对 Qwen2.5-VL 模型系列 (3B, 7B) 和六个医学 QA 基准的广泛实验中,我们发现 RLVR 在所有情况下都显著优于 SFT。此外,在 RLVR 框架下,一个关键的反直觉发现是,训练我们筛选好的文本-only 推理数据比训练多模态图像-文本数据能提供更大的性能提升。我们最好的开放 7B 模型,在 RLVR 框架下使用文本-only 数据训练,建立了现有公开 VQA 基准的最新状态,超越了所有之前的开源医学 LMM。此外,将模型扩展到 32B 后,性能与专有 GPT-4o 持平。我们发布所有筛选数据、模型和代码,为社区提供一个强大、开放的基础,以进行多模态医学推理的未来研究。

关键词

引用

@article{arxiv.2508.02669,
  title  = {MedVLThinker: Simple Baselines for Multimodal Medical Reasoning},
  author = {Xiaoke Huang and Juncheng Wu and Hui Liu and Xianfeng Tang and Yuyin Zhou},
  journal= {arXiv preprint arXiv:2508.02669},
  year   = {2026}
}

备注

Project page: https://ucsc-vlaa.github.io/MedVLThinker/ ; Code: https://github.com/UCSC-VLAA/MedVLThinker ; Model and Data: https://huggingface.co/collections/UCSC-VLAA/medvlthinker-688f52224fb7ff7d965d581d ; Accepted by ML4H'25