中文

Swin-LiteMedSAM:用于大规模医学图像数据集的轻量级基于框的分段模型

计算机视觉与模式识别 2024-09-12 v1

摘要

医学成像对于疾病的诊断和治疗至关重要,医学图像分割作为其子任务受到高度关注。然而,自动医学图像分割模型通常具有任务特定性,难以处理多种情形,例如不同的成像模态和感兴趣区域。随着分段模型 (SAM) 的引入,为各种临床场景训练通用模型变得可行。最近提出了几种 Medical SAM (MedSAM) 方法,但这些模型通常依赖重型图像编码器以实现高性能,由于计算需求高和推理速度慢,在实际应用中可能并不实用。为此,一种轻量级 MedSAM (LiteMedSAM) 版本可以提供可行解决方案,在更少的资源和时间内实现高性能。本文引入了 Swin-LiteMedSAM,这是 LiteMedSAM 的一个新变体。该模型集成了微型 Swin Transformer 作为图像编码器,包含多种类型的提示,包括基于框的点和由给定边界框生成的涂鸦,并在图像编码器和掩码解码器之间建立了 skip 连接。在“在笔记本电脑上进行医学图像分段”挑战(CVPR 2024)中,我们的方法在分割性能和速度之间取得了良好平衡,相较于挑战组织者提供的 LiteMedSAM 基线方法,在多个模态上实现了显著的整体性能提升。我们的方法在验证集上获得了 DSC 分数为 \textbf{0.8678} 和 NSD 分数为 \textbf{0.8844}。在最终测试集上,实现了 DSC 分数为 \textbf{0.8193} 和 NSD 分数为 \textbf{0.8461},在挑战中获得第四名。

关键词

引用

@article{arxiv.2409.07172,
  title  = {Swin-LiteMedSAM: A Lightweight Box-Based Segment Anything Model for Large-Scale Medical Image Datasets},
  author = {Ruochen Gao and Donghang Lyu and Marius Staring},
  journal= {arXiv preprint arXiv:2409.07172},
  year   = {2024}
}

备注

13 pages