中文

VM-UNET-V2:重新思考用于医学图像分割的 Vision Mamba UNet

图像与视频处理 2024-03-15 v1 计算机视觉与模式识别

摘要

在医学图像分割领域,基于 CNN 和 Transformer 的模型均已得到深入研究。然而,CNN 对长程依赖的建模能力有限,使得充分利用图像内的语义信息极具挑战。另一方面,二次计算复杂度给 Transformer 带来了挑战。最近,状态空间模型(SSM),如 Mamba,被认为是一种极具前景的方法。它们不仅在建模长程交互方面展现出卓越的性能,同时保持了线性的计算复杂度。受 Mamba 架构启发,我们提出了 Vision Mamba-UNetV2,引入视觉状态空间(VSS)模块以捕获广泛的上下文信息,并引入语义与细节注入(SDI)以增强低级和高级特征的融合。我们在 ISIC17、ISIC18、CVC-300、CVC-ClinicDB、Kvasir、CVC-ColonDB 和 ETIS-LaribPolypDB 公共数据集上进行了全面实验。结果表明,VM-UNetV2 在医学图像分割任务中表现出极具竞争力的性能。我们的代码可在 https://github.com/nobodyplayer1/VM-UNetV2 获取。

关键词

引用

@article{arxiv.2403.09157,
  title  = {VM-UNET-V2 Rethinking Vision Mamba UNet for Medical Image Segmentation},
  author = {Mingya Zhang and Yue Yu and Limei Gu and Tingsheng Lin and Xianping Tao},
  journal= {arXiv preprint arXiv:2403.09157},
  year   = {2024}
}

备注

12 pages, 4 figures