Vision xLSTM嵌入的UNet在医学3D图像分割中是否更可靠?
图像与视频处理
2025-08-08 v3 计算机视觉与模式识别
摘要
医学图像高效分割策略的发展已从最初依赖卷积神经网络(CNN)演变到目前对结合CNN与视觉Transformer(ViT)的混合模型的探索。人们越来越关注创建既高性能又计算高效、能够在资源有限的远程系统上部署的架构。尽管Transformer可以捕获输入空间中的全局依赖关系,但它们面临着相应的高计算和存储开销的挑战。本研究通过引入新颖的U-VixLSTM,探索了CNN与视觉扩展长短期记忆网络(Vision-xLSTM)的集成。Vision-xLSTM模块捕获从CNN特征图中提取的块内的时序和全局关系。卷积特征重建路径对来自Vision-xLSTM模块的输出体进行上采样,以产生分割输出。我们的主要目标是提出Vision-xLSTM构成了医学图像分割的合适骨干网络,在降低计算成本的同时提供卓越的性能。在公开可用的Synapse、ISIC和ACDC数据集上,U-VixLSTM表现出优于最先进网络的性能。代码提供:https://github.com/duttapallabi2907/U-VixLSTM
引用
@article{arxiv.2406.16993,
title = {Are Vision xLSTM Embedded UNet More Reliable in Medical 3D Image Segmentation?},
author = {Pallabi Dutta and Soham Bose and Swalpa Kumar Roy and Sushmita Mitra},
journal= {arXiv preprint arXiv:2406.16993},
year = {2025}
}