中文

MedVL-SAM2:面向多模态推理与提示驱动分割的统一三维医学视觉语言模型

计算机视觉与模式识别 2026-01-16 v1 人工智能

摘要

医学视觉语言模型(VLM)的最新进展在报告生成和视觉问答(VQA)等图像级文本中心任务上取得了显著性能。然而,在三维医学VLM中实现细粒度视觉定位和体积空间推理仍然具有挑战性,尤其当目标是将这些能力统一在一个单一、可泛化的框架内时。为应对这一挑战,我们提出了MedVL-SAM2,一个统一的三维医学多模态模型,可同时支持报告生成、视觉问答以及多范式分割,包括语义分割、指代分割和交互式分割。MedVL-SAM2通过一个为三维医学数据量身定制的内聚架构,整合了图像级推理与像素级感知,并引入了一个基于SAM2的体积分割模块,以实现精确的多粒度空间推理。该模型采用多阶段训练流程:首先在一个大规模三维CT图像-文本对语料库上进行预训练,以对齐体积视觉特征与放射学语言嵌入。然后,利用一个全面的三维CT分割数据集,通过语言理解和分割目标进行联合优化。这种联合训练能够通过语言、点或框提示实现灵活交互,从而将高层视觉推理与空间精确定位统一起来。我们的统一架构在报告生成、视觉问答和多种三维分割任务上均达到了最先进的性能。广泛的分析进一步表明,该模型提供了可靠的三维视觉定位、可控的交互式分割和鲁棒的跨模态推理,证明了高层语义推理与精确三维空间定位可以在一个统一的三维医学VLM中共同实现。

关键词

引用

@article{arxiv.2601.09879,
  title  = {MedVL-SAM2: A unified 3D medical vision-language model for multimodal reasoning and prompt-driven segmentation},
  author = {Yang Xing and Jiong Wu and Savas Ozdemir and Ying Zhang and Yang Yang and Wei Shao and Kuang Gong},
  journal= {arXiv preprint arXiv:2601.09879},
  year   = {2026}
}