中文

MedMamba:用于医学图像分类的 Vision Mamba

图像与视频处理 2024-10-01 v5 计算机视觉与模式识别 机器学习

摘要

自深度学习时代以来,卷积神经网络(CNNs)和视觉 Transformer(ViTs)已在医学图像分类任务中得到广泛研究和应用。不幸的是,CNN 在建模长程依赖方面的局限性导致其分类性能不佳。相比之下,ViTs 受限于其自注意力机制的二次计算复杂度,难以在计算资源有限的实际场景中部署。最近的研究表明,以 Mamba 为代表的状态空间模型(SSMs)能够在保持线性计算复杂度的同时有效建模长程依赖。受此启发,我们提出了 MedMamba,这是首个用于通用医学图像分类的 Vision Mamba。具体而言,我们引入了一种名为 SS-Conv-SSM 的新型混合基本模块,该模块纯粹地整合了用于提取局部特征的卷积层与 SSM 捕捉长程依赖的能力,旨在高效地对不同模态的医学图像进行建模。通过采用分组卷积策略和通道混洗操作,MedMamba 在不牺牲精度的前提下,成功减少了模型参数量并降低了计算负担,适用于高效应用。我们使用包含 10 种成像模态和 411,007 张图像的 16 个数据集对 MedMamba 进行了全面评估。实验结果表明,与最先进的方法相比,MedMamba 在大多数任务上表现出具有竞争力的性能。这项工作旨在探索 Vision Mamba 的潜力,并为医学图像分类建立新的基准,从而为开发更强大的基于 Mamba 的人工智能算法及其在医学中的应用提供有价值的见解。MedMamba 的源代码和所有预训练权重可在 https://github.com/YubiaoYue/MedMamba 获取。

关键词

引用

@article{arxiv.2403.03849,
  title  = {MedMamba: Vision Mamba for Medical Image Classification},
  author = {Yubiao Yue and Zhenzhang Li},
  journal= {arXiv preprint arXiv:2403.03849},
  year   = {2024}
}