MSVM-UNet:用于医学图像分割的多尺度 Vision Mamba UNet
计算机视觉与模式识别
2024-08-27 v1
摘要
状态空间模型(SSM),尤其是 Mamba,因其能够以线性计算复杂度建模长程依赖,显示出在医学图像分割中的巨大潜力。然而,准确的医学图像分割需要有效学习多尺度细节特征表征和全局上下文依赖。虽然已有工作尝试通过集成 CNN 和 SSM 来利用二者的优势,但未设计专门的模块来有效捕获多尺度特征表征,也未充分解决将 Mamba 应用于二维图像数据时的方向敏感性问题。为克服这些限制,我们提出一种用于医学图像分割的多尺度 Vision Mamba UNet 模型,称为 MSVM-UNet。具体而言,通过在 VSS 块中引入多尺度卷积,可更有效地捕获和聚合来自 VMamba 编码器层次特征的多尺度特征表征,并更好地处理二维视觉数据。此外,大核卷积扩展(LKPE)层通过同时整合空间和通道信息,实现更高效的特征图上采样。在 Synapse 和 ACDC 数据集上的大量实验表明,我们的方法在捕获和聚合多尺度特征表征以及像素之间建模长程依赖方面优于一些最新方法。
引用
@article{arxiv.2408.13735,
title = {MSVM-UNet: Multi-Scale Vision Mamba UNet for Medical Image Segmentation},
author = {Chaowei Chen and Li Yu and Shiquan Min and Shunfang Wang},
journal= {arXiv preprint arXiv:2408.13735},
year = {2024}
}
备注
8 pages, 5 figures