MedReasoner:强化学习驱动从临床思维到像素级精度的推理定位
计算机视觉与模式识别
2026-02-19 v3 人工智能
摘要
在医学影像中,精确地定位感兴趣区域(ROI)对于诊断和治疗规划至关重要。虽然多模态大语言模型(MLLM)结合了视觉感知与自然语言,但当前的医学定位流程仍然依赖于带有明确空间提示的监督微调,这使得它们难以处理临床实践中常见的隐式查询。本工作做出了三个核心贡献。首先,我们定义了统一医学推理定位(UMRG),这是一个需要临床推理和像素级定位的新颖视觉-语言任务。其次,我们发布了 U-MRG-14K,一个包含 14K 样本的数据集,这些样本具有像素级掩膜以及隐式临床查询和推理轨迹,涵盖 10 种模态、15 个超类别和 108 个具体类别。最后,我们引入了 MedReasoner,这是一个模块化框架,明确地将推理与分割分离开来:一个 MLLM 推理器通过强化学习进行优化,而一个冻结的分割专家将空间提示转换为掩膜,通过格式和准确性奖励实现对齐。MedReasoner 在 U-MRG-14K 上达到了最先进的性能,并对未见过的临床查询表现出强大的泛化能力,突显了强化学习在可解释医学定位方面的巨大潜力。
引用
@article{arxiv.2508.08177,
title = {MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision},
author = {Zhonghao Yan and Muxi Diao and Yuxuan Yang and Ruoyan Jing and Jiayuan Xu and Kaizhou Zhang and Lele Yang and Yanxi Liu and Kongming Liang and Zhanyu Ma},
journal= {arXiv preprint arXiv:2508.08177},
year = {2026}
}
备注
AAAI2026