MedSeg-R: 利用多模态大语言模型进行医学图像推理分割
计算机视觉与模式识别
2025-06-13 v1
摘要
医学图像分割对于临床诊断至关重要,然而现有模型受限于其对显式人工指令的依赖,且缺乏理解复杂临床问题的主动推理能力。尽管多模态大语言模型(MLLM)的最新进展改善了医学问答(QA)任务,但大多数方法难以生成精确的分割掩码,限制了其在自动医学诊断中的应用。本文提出医学图像推理分割,一种旨在基于复杂且隐式的医学指令生成分割掩码的新任务。为解决这一问题,我们提出 MedSeg-R,一个端到端框架,利用 MLLM 的推理能力来解读临床问题,同时能够生成相应的精确分割掩码。它由两个核心组件构建:1)一个全局上下文理解模块,用于解读图像并理解复杂医学指令以生成多模态中间标记;2)一个像素级定位模块,用于将这些标记解码为精确的分割掩码和文本响应。此外,我们引入了 MedSeg-QA,一个专为医学图像推理分割任务设计的大规模数据集。它包含超过 10,000 个图像-掩码对和多轮对话,通过大语言模型自动标注并经医生审核完善。实验表明 MedSeg-R 在多个基准测试上表现出优越性能,实现了高分割精度并支持医学图像的可解释文本分析。
引用
@article{arxiv.2506.10465,
title = {MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models},
author = {Yu Huang and Zelin Peng and Yichen Zhao and Piao Yang and Xiaokang Yang and Wei Shen},
journal= {arXiv preprint arXiv:2506.10465},
year = {2025}
}
备注
{\dag}: Equal contribution