VM-UNet:用于医学图像分割的 Vision Mamba UNet
图像与视频处理
2024-11-11 v2 计算机视觉与模式识别
摘要
在医学图像分割领域,基于 CNN 和基于 Transformer 的模型已被广泛探索。然而,CNN 在长程建模能力方面存在局限性,而 Transformer 则受限于其二次计算复杂度。最近,以 Mamba 为代表的状态空间模型作为一种极具前景的方法出现。它们不仅在长程交互建模方面表现出色,同时保持了线性的计算复杂度。在本文中,利用状态空间模型,我们提出了一种用于医学图像分割的 U 形架构模型,命名为 Vision Mamba UNet (VM-UNet)。具体而言,引入视觉状态空间块作为基础块以捕获广泛的上下文信息,并构建了具有较少卷积层的非对称编码器-解码器结构以节省计算成本。我们在 ISIC17、ISIC18 和 Synapse 数据集上进行了全面实验,结果表明 VM-UNet 在医学图像分割任务中具有竞争力的性能。据我们所知,这是首个基于纯 SSM 模型构建的医学图像分割模型。我们旨在为未来更高效、更有效的基于 SSM 的分割系统的开发建立基线并提供有价值的见解。我们的代码可在 https://github.com/JCruan519/VM-UNet 获取。
引用
@article{arxiv.2402.02491,
title = {VM-UNet: Vision Mamba UNet for Medical Image Segmentation},
author = {Jiacheng Ruan and Jincheng Li and Suncheng Xiang},
journal= {arXiv preprint arXiv:2402.02491},
year = {2024}
}
备注
9 pages, 5 figures, 6 tables. Work in progress