SegFormer3D:一种用于3D医学图像分割的高效Transformer
计算机视觉与模式识别
2024-04-25 v2
摘要
基于视觉Transformer(ViTs)架构的采用代表了3D医学图像分割领域的重大进步,通过增强全局上下文理解超越了传统的卷积神经网络(CNN)模型。虽然这种范式转变显著提升了3D分割性能,但最先进的架构需要极其庞大复杂的架构以及大规模计算资源进行训练和部署。此外,在医学影像中常遇到的有限数据集背景下,更大的模型可能在模型泛化和收敛两方面带来障碍。为应对这些挑战并证明轻量级模型是3D医学成像中一个有价值的研究方向,我们提出了SegFormer3D,一种跨多尺度体素特征计算注意力的分层Transformer。此外,SegFormer3D避免了复杂的解码器,使用全MLP解码器聚合局部和全局注意力特征,生成高精度的分割掩码。所提出的内存高效Transformer在紧凑设计中保留了显著更大模型的性能特征。与当前最先进(SOTA)模型相比,SegFormer3D的参数减少了33倍,GFLOPS降低了13倍,从而实现了3D医学图像分割的深度学习民主化。我们在三个广泛使用的数据集Synapse、BRaTs和ACDC上对SegFormer3D与当前SOTA模型进行了基准测试,取得了具有竞争力的结果。代码:https://github.com/OSUPCVLab/SegFormer3D.git
引用
@article{arxiv.2404.10156,
title = {SegFormer3D: an Efficient Transformer for 3D Medical Image Segmentation},
author = {Shehan Perera and Pouyan Navard and Alper Yilmaz},
journal= {arXiv preprint arXiv:2404.10156},
year = {2024}
}
备注
Accepted at CVPR Workshop 2024