MaskSAM:面向体积医学图像分割的基于掩码分类的自动提示SAM
计算机视觉与模式识别
2025-03-25 v2
摘要
Segment Anything Model (SAM) 是一种用于自然图像分割的提示驱动基础模型,展现了令人印象深刻的零样本性能。然而,SAM 直接应用于医学图像分割时效果不佳,因为它缺乏预测语义标签的能力,需要额外的提示,并且性能欠佳。针对上述问题,我们提出了 MaskSAM,一种新颖的、无需提示的掩码分类 SAM 适配框架,用于医学图像分割。我们设计了一个与 SAM 中图像编码器结合的提示生成器,以生成一组辅助分类器令牌、辅助二值掩码和辅助边界框。每对辅助掩码和边界框提示可以解决额外提示的需求。语义标签预测可以通过 SAM 掩码解码器中辅助分类器令牌与可学习的全局分类器令牌之和来解决。同时,我们为图像嵌入设计了一个 3D 深度卷积适配器,并为提示嵌入设计了一个 3D 深度 MLP 适配器,以高效微调 SAM。我们的方法在 AMOS2022 数据集上取得了最先进的性能,Dice 系数达到 90.52%,相比 nnUNet 提升了 2.7%。在 ACDC 和 Synapse 数据集上,我们的方法分别比 nnUNet 高出 1.7% 和 1.0%。
引用
@article{arxiv.2403.14103,
title = {MaskSAM: Towards Auto-prompt SAM with Mask Classification for Volumetric Medical Image Segmentation},
author = {Bin Xie and Hao Tang and Bin Duan and Dawen Cai and Yan Yan and Gady Agam},
journal= {arXiv preprint arXiv:2403.14103},
year = {2025}
}