中文

Weak-Mamba-UNet:视觉 Mamba 提升 CNN 和 ViT 在基于涂鸦的医学图像分割中的表现

图像与视频处理 2024-02-19 v1 计算机视觉与模式识别

摘要

医学图像分割日益依赖深度学习技术,然而其优异性能往往伴随着高昂的标注成本。本文介绍了 Weak-Mamba-UNet,这是一种创新的弱监督学习(WSL)框架,利用卷积神经网络(CNN)、视觉 Transformer(ViT)以及前沿的视觉 Mamba(VMamba)架构进行医学图像分割,特别是在处理基于涂鸦的标注时。所提出的 WSL 策略融合了三种不同但具有相同对称编码器 - 解码器网络结构的架构:基于 CNN 的 UNet 用于详细的局部特征提取,基于 Swin Transformer 的 SwinUNet 用于全面的全局上下文理解,以及基于 VMamba 的 Mamba-UNet 用于高效的长程依赖建模。该框架的核心概念是一种协作且交叉监督的机制,利用伪标签促进网络间的迭代学习与 refinement。Weak-Mamba-UNet 的有效性在公开的带有处理后涂鸦标注的心脏 MRI 分割数据集上得到验证,其性能超越了仅使用 UNet 或 SwinUNet 的类似 WSL 框架。这突显了其在稀疏或不精确标注场景中的潜力。源代码已公开。

关键词

引用

@article{arxiv.2402.10887,
  title  = {Weak-Mamba-UNet: Visual Mamba Makes CNN and ViT Work Better for Scribble-based Medical Image Segmentation},
  author = {Ziyang Wang and Chao Ma},
  journal= {arXiv preprint arXiv:2402.10887},
  year   = {2024}
}