中文

Medical SAM3:面向通用提示驱动医学图像分割的基础模型

计算机视觉与模式识别 2026-01-19 v1 人工智能

摘要

诸如 SAM3 之类的可提示分割基础模型已通过交互式和基于概念的提示展现出强大的泛化能力。然而,它们对医学图像分割的直接适用性仍受到严重领域偏移、缺乏特权空间提示以及对复杂解剖结构和体积结构进行推理的需求的限制。在此,我们提出 Medical SAM3,一个面向通用提示驱动医学图像分割的基础模型,通过在带有配对分割掩码和文本提示的大规模、异构 2D 和 3D 医学影像数据集上对 SAM3 进行全参数微调而获得。通过对原始 SAM3 的系统分析,我们观察到其在医学数据上的性能显著下降,其表面上的竞争力在很大程度上依赖于诸如源自真实值的边界框等强几何先验。这些发现促使了超越单纯提示工程的全模型适配。通过在跨越 10 种医学成像模态的 33 个数据集上微调 SAM3 的模型参数,Medical SAM3 获得了稳健的特定领域表示,同时保持了提示驱动的灵活性。跨器官、成像模态和维度的广泛实验证明了一致且显著的性能提升,特别是在以语义模糊、复杂形态和长程 3D 上下文为特征的极具挑战性的场景中。我们的结果确立了 Medical SAM3 作为面向医学影像的通用、文本引导的分割基础模型,并强调了整体模型适配对于在严重领域偏移下实现稳健的提示驱动分割的重要性。代码和模型将发布于 https://github.com/AIM-Research-Lab/Medical-SAM3。

关键词

引用

@article{arxiv.2601.10880,
  title  = {Medical SAM3: A Foundation Model for Universal Prompt-Driven Medical Image Segmentation},
  author = {Chongcong Jiang and Tianxingjian Ding and Chuhan Song and Jiachen Tu and Ziyang Yan and Yihua Shao and Zhenyi Wang and Yuzhang Shang and Tianyu Han and Yu Tian},
  journal= {arXiv preprint arXiv:2601.10880},
  year   = {2026}
}