HMT-UNet:用于医学图像分割的混合Mamba-Transformer视觉UNet
图像与视频处理
2024-09-10 v2 计算机视觉与模式识别
摘要
在医学图像分割领域,基于CNN和Transformer的模型已被广泛研究。然而,CNN对长距离依赖关系的建模能力有限,难以充分利用图像中的语义信息。另一方面,Transformer的二次方计算复杂度也带来了挑战。状态空间模型(SSM),如Mamba,已被认为是一种有前景的方法。它们不仅在长距离交互建模方面表现出优越的性能,而且保持了线性计算复杂度。SSM(状态空间模型)与Transformer的混合机制,经过精心设计,可以增强其对视觉特征的高效建模能力。大量实验表明,在Mamba架构层之后的混合部分中集成自注意力机制,可以显著提高捕获长距离空间依赖关系的能力。本文利用SSM的混合机制,提出了一种用于医学图像分割的U型架构模型,命名为Hybird Transformer vision Mamba UNet(HTM-UNet)。我们在ISIC17、ISIC18、CVC-300、CVC-ClinicDB、Kvasir、CVC-ColonDB、ETIS-Larib PolypDB公共数据集以及ZD-LCI-GIM私有数据集上进行了全面实验。结果表明,HTM-UNet在医学图像分割任务中表现出具有竞争力的性能。代码可在 https://github.com/simzhangbest/HMT-Unet 获取。
关键词
引用
@article{arxiv.2408.11289,
title = {HMT-UNet: A hybird Mamba-Transformer Vision UNet for Medical Image Segmentation},
author = {Mingya Zhang and Zhihao Chen and Yiyuan Ge and Xianping Tao},
journal= {arXiv preprint arXiv:2408.11289},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2403.09157; text overlap with arXiv:2407.08083 by other authors