MISSU:基于自蒸馏 TransUNet 的三维医学图像分割
计算机视觉与模式识别
2022-06-03 v1
摘要
U-Net 在医学图像分割中取得了巨大成功。然而,其在全局(长程)上下文交互与边缘细节保持方面可能存在局限。相比之下,Transformer 通过将自注意力机制引入编码器,具有出色的捕获长程依赖的能力。尽管 Transformer 生来便用于对提取的特征图建模长程依赖,但在处理高分辨率 3D 特征图时仍面临极高的计算与空间复杂度。这促使我们设计高效的基于 Transformer 的 UNet 模型,并研究基于 Transformer 的网络架构用于医学图像分割任务的可行性。为此,我们提出对基于 Transformer 的 UNet 进行自蒸馏用于医学图像分割,其同时学习全局语义信息与局部空间细节特征。同时,首次提出局部多尺度融合模块,通过自蒸馏由主 CNN 主干从编码器跳跃连接中精炼细粒度细节,该模块仅在训练时计算并在推理时移除,开销极小。在 BraTS 2019 与 CHAOS 数据集上的大量实验表明,我们的 MISSU 优于以往最先进的方法。代码与模型见 \url{https://github.com/wangn123/MISSU.git}
引用
@article{arxiv.2206.00902,
title = {MISSU: 3D Medical Image Segmentation via Self-distilling TransUNet},
author = {Nan Wang and Shaohui Lin and Xiaoxiao Li and Ke Li and Yunhang Shen and Yue Gao and Lizhuang Ma},
journal= {arXiv preprint arXiv:2206.00902},
year = {2022}
}