xLSTM-UNet 可作为具备更优于Mamba模型的Vision-LSTM的2D与3D医学图像分割骨干网络
图像与视频处理
2024-07-03 v2 计算机视觉与模式识别
摘要
卷积神经网络(CNNs)和视觉Transformer(ViT)在生物医学图像分割中发挥了关键作用,但其处理长程依赖的能力仍受制于内在的局部性和计算开销。为克服这些挑战,本技术报告首先提出xLSTM-UNet,这是一种基于Vision-LSTM(xLSTM)作为骨干网络的生物医学图像分割深度学习神经网络结构。xLSTM是长短期记忆网络(LSTM)的最新提出版本,在神经语言处理(NLP)和图像分类(如在Vision-LSTM或ViL实现中所示)中已显示出优于Transformer和状态空间模型(SSM)如Mamba的优越性能。本文所设计的xLSTM-UNet延续了在生物医学图像分割领域的成功。通过将卷积层的局部特征提取优势与xLSTM的长程依赖捕获能力相结合,xLSTM-UNet为综合图像分析提供了稳健的解决方案。我们通过实验验证了xLSTM-UNet的有效性。我们的发现表明,xLSTM-UNet在生物医学分割多个数据集上 consistently 优于领先的基于CNN、Transformer和Mamba的分割网络,包括腹部MRI器官、内窥镜图像中的器械以及显微镜图像中的细胞。通过进行全面实验,本技术报告凸显了xLSTM基于架构在推动生物医学图像分析中,尤其是在2D和3D中的潜力。代码、模型和数据集均可在http://tianrun-chen.github.io/xLSTM-UNet/公开获取。
引用
@article{arxiv.2407.01530,
title = {xLSTM-UNet can be an Effective 2D & 3D Medical Image Segmentation Backbone with Vision-LSTM (ViL) better than its Mamba Counterpart},
author = {Tianrun Chen and Chaotao Ding and Lanyun Zhu and Tao Xu and Deyi Ji and Yan Wang and Ying Zang and Zejian Li},
journal= {arXiv preprint arXiv:2407.01530},
year = {2024}
}