MIST:具有卷积注意力混合(CAM)解码器的医学图像分割Transformer
计算机视觉与模式识别
2023-11-01 v1 机器学习
摘要
用于医学图像分割的常见且有前景的深度学习方法之一是Transformer,因其可利用自注意力捕获像素间的长程依赖。尽管在医学图像分割中取得成功,Transformer在捕获多模态维度下像素的局部上下文方面存在局限。我们提出一种医学图像分割Transformer(MIST),其引入了新颖的卷积注意力混合(CAM)解码器以解决该问题。MIST包含两部分:使用预训练的多轴视觉Transformer(MaxViT)作为编码器,并将编码后的特征表示通过CAM解码器以分割图像。在CAM解码器中,引入了结合多头自注意力、空间注意力与压缩激励注意力模块的注意力混合器,以在所有空间维度捕获长程依赖。此外,为增强空间信息获取,分别使用深层与浅层卷积进行特征提取与感受野扩展。不同网络阶段低级与高级特征的融合由跳跃连接实现,使MIST能够抑制不必要信息。实验表明,我们的带CAM解码器的MIST Transformer在ACDC与Synapse数据集上优于专为医学图像分割设计的SOTA模型。我们的结果还表明,将CAM解码器与分层Transformer结合可显著提升分割性能。我们的模型及数据与代码已在GitHub公开。
引用
@article{arxiv.2310.19898,
title = {MIST: Medical Image Segmentation Transformer with Convolutional Attention Mixing (CAM) Decoder},
author = {Md Motiur Rahman and Shiva Shokouhmand and Smriti Bhatt and Miad Faezipour},
journal= {arXiv preprint arXiv:2310.19898},
year = {2023}
}
备注
10 pages, 2 figures, 3 tables, accepted for publication in WACV 2024