Swin SMT:3D医学图像分割中的全局顺序建模
图像与视频处理
2024-07-11 v1 计算机视觉与模式识别
摘要
近期视觉变换器(Vision Transformers, ViTs)的进展显著提升了医学图像分割性能,通过促进全局关系的学习。然而,这些方法在捕捉多样化的局部和全局长程顺序特征表示方面面临显著挑战,尤其在全身CT(WBCT)扫描中表现突出。为克服这一限制,我们提出Swin软混合变换器(Swin Soft Mixture Transformer, Swin SMT),一种基于Swin UNETR的新型架构。该模型引入软混合专家(Soft Mixture-of-Experts, Soft MoE),有效处理复杂且多样的长程依赖关系。软MoE的使用允许在保持训练和推理模式下计算复杂度与分割性能平衡的前提下,扩展模型参数规模。我们在公开的TotalSegmentator-V2数据集上对Swin SMT进行评估,该数据集包含WBCT图像中的117种主要解剖结构。综合实验结果表明,Swin SMT在3D解剖结构分割方面优于多个最新方法,平均Dice相似系数达到85.09%。Swin SMT的代码和预训练权重已公开发布于https://github.com/MI2DataLab/SwinSMT。
引用
@article{arxiv.2407.07514,
title = {Swin SMT: Global Sequential Modeling in 3D Medical Image Segmentation},
author = {Szymon Płotka and Maciej Chrabaszcz and Przemyslaw Biecek},
journal= {arXiv preprint arXiv:2407.07514},
year = {2024}
}
备注
Accepted to MICCAI 2024 (early accept)