MobileViM:一种用于三维医学图像分析的轻量级且与维度无关的视觉 Mamba
计算机视觉与模式识别
2025-03-07 v4 人工智能
机器学习
网络与互联网体系结构
摘要
高效评估三维(3D)医学图像对于医疗保健中的诊断和治疗实践至关重要。近年来,深度学习和计算机视觉在分析和解释医学图像方面的应用大幅增加。传统方法,如卷积神经网络(CNN)和视觉 Transformer(ViT),面临重大的计算挑战,促使了对架构改进的需求。最近的研究引入了诸如“Mamba”模型等新颖架构,作为传统 CNN 或 ViT 的替代方案。Mamba 模型擅长以较低的计算需求对一维数据进行线性处理。然而,Mamba 在 3D 医学图像分析中的潜力仍有待探索,并且随着维度的增加可能面临重大的计算挑战。本文提出了 MobileViM,一种用于 3D 医学图像高效分割的精简架构。在 MobileViM 网络中,我们发明了一种新的与维度无关的机制和一种双向遍历方法,以与基于视觉 Mamba 的框架相结合。MobileViM 还具有跨尺度桥接技术,以提高各种医学成像模态的效率和准确性。凭借这些增强,MobileViM 在单个图形处理器(即 NVIDIA RTX 4090)上实现了超过每秒 90 帧(FPS)的分割速度。在使用相同计算资源处理 3D 图像时,该性能比 SOTA 深度学习模型快 24 FPS 以上。此外,实验评估表明 MobileViM 提供了卓越的性能,在 PENGWIN、BraTS2024、ATLAS 和 Toothfairy2 数据集上的 Dice 相似度得分分别达到 92.72%、86.69%、80.46% 和 77.43%,显著超越了现有模型。
引用
@article{arxiv.2502.13524,
title = {MobileViM: A Light-weight and Dimension-independent Vision Mamba for 3D Medical Image Analysis},
author = {Wei Dai and Jun Liu},
journal= {arXiv preprint arXiv:2502.13524},
year = {2025}
}
备注
The corresponding author disagrees with the manuscript submitted to arXiv