通过分层解码释放 SAM 在医学图像适配中的潜力
计算机视觉与模式识别
2024-03-28 v1
摘要
Segment Anything Model (SAM) 因其通用的分割能力和直观的基于提示的界面而备受关注。然而,其在医学成像中的应用面临挑战,要么需要高昂的训练成本和大量医学数据集来进行全模型微调,要么需要高质量提示才能获得最佳性能。本文提出了 H-SAM:一种无提示的 SAM 适配方法,通过两阶段分层解码过程专为医学图像的高效微调而设计。在初始阶段,H-SAM 采用 SAM 的原始解码器生成先验概率掩码,以指导第二阶段中更复杂的解码过程。具体而言,我们提出了两个关键设计:1) 一种类别平衡的掩码引导自注意力机制,用于解决标签分布不平衡问题并增强图像嵌入;2) 一种可学习的掩码交叉注意力机制,基于先验掩码在空间上调制不同图像区域间的相互作用。此外,H-SAM 中引入的分层像素解码器增强了其捕获细粒度和局部细节的能力。该方法使 SAM 能够有效整合学习到的医学先验,从而在样本有限的情况下促进医学图像分割的更好适配。在仅使用 10% 2D 切片进行多器官分割时,与现有的无提示 SAM 变体相比,我们的 H-SAM 的平均 Dice 提升了 4.78%。值得注意的是,在不使用任何无标签数据的情况下,H-SAM 甚至在各种医学数据集上超越了依赖大量无标签训练数据的当前最先进的半监督模型。代码可在 https://github.com/Cccccczh404/H-SAM 获取。
引用
@article{arxiv.2403.18271,
title = {Unleashing the Potential of SAM for Medical Adaptation via Hierarchical Decoding},
author = {Zhiheng Cheng and Qingyue Wei and Hongru Zhu and Yan Wang and Liangqiong Qu and Wei Shao and Yuyin Zhou},
journal= {arXiv preprint arXiv:2403.18271},
year = {2024}
}
备注
CVPR 2024