3D-EffiViTCaps:用于医学图像分割的3D高效视觉Transformer带胶囊网络
图像与视频处理
2024-03-26 v1 计算机视觉与模式识别
摘要
医学图像分割(MIS)旨在精细分割 various 器器官。它要求从图像的各部分以及整体中获取全局信息,以实现更好的分割效果,而临床应用中往往对分割效率有明确要求。卷积神经网络(CNN)在MIS领域取得了显著成果。然而,它们难以充分收集全局上下文信息,且池化层可能导致信息丢失。近期,结合了CNN优势且考虑了相对位置等额外信息(CNN不考虑的因素)的胶囊网络在MIS中展现出一定优势。视觉Transformer(ViT)在视觉任务中应用了Transformer技术。基于注意力机制的Transformer在全局归纳建模方面表现出色,能够捕获长程信息。此外,近期有研究致力于使ViT更轻量化,以降低模型复杂度并提高效率。本文提出了一种U型3D编码器-解码器网络,命名为3D-EffiViTCaps,将3D胶囊模块与3D EfficientViT模块结合用于MIS。我们的编码器采用胶囊模块和EfficientViT模块,有效且高效地联合捕获局部和全局语义信息,同时减少信息丢失;解码器则采用CNN模块和EfficientViT模块以捕获更细致的分割细节。我们在多个数据集上进行实验,包括iSeg-2017、Hippocampus和Cardiac,以验证3D-EffiViTCaps的性能和效率,该模型在以往基于3D CNN、3D胶囊网络和3D Transformer模型的基准上表现更优。我们还对主要模块进行了一系列消融实验。我们的代码已公开:https://github.com/HidNeuron/3D-EffiViTCaps。
引用
@article{arxiv.2403.16350,
title = {3D-EffiViTCaps: 3D Efficient Vision Transformer with Capsule for Medical Image Segmentation},
author = {Dongwei Gan and Ming Chang and Juan Chen},
journal= {arXiv preprint arXiv:2403.16350},
year = {2024}
}
备注
15 pages, 4 figures, submitted to ICPR2024