中文

ConvFormer: 用于改进医学图像分割的即插即用 CNN 式 Transformer

图像与视频处理 2023-09-13 v1 计算机视觉与模式识别

摘要

Transformer 已在医学图像分割中被广泛研究以构建成对的长程依赖。然而,相对有限的精标注医学图像数据使 Transformer 难以提取多样的全局特征,导致注意力崩溃,即注意力图变得相似甚至相同。相比之下,卷积神经网络(CNN)在小规模训练数据上具有更好的收敛特性,但受限于有限的感受野。现有工作致力于探索 CNN 与 Transformer 的组合,却忽视了注意力崩溃,使得 Transformer 的潜力未被充分发掘。本文提出构建 CNN 式 Transformer(ConvFormer)以促进更好的注意力收敛,从而获得更好的分割性能。具体而言,ConvFormer 由池化、CNN 式自注意力(CSA)和卷积前馈网络(CFFN)组成,分别对应原始视觉 Transformer 中的分词、自注意力和前馈网络。与位置嵌入和分词不同,ConvFormer 采用二维卷积和最大池化来同时保留位置信息并缩减特征尺寸。由此,CSA 以二维特征图作为输入,并通过构建具有自适应尺寸的卷积核形式的自注意力矩阵建立长程依赖。在 CSA 之后,利用二维卷积通过 CFFN 进行特征细化。在多个数据集上的实验结果证明了 ConvFormer 作为即插即用模块对基于 Transformer 的框架实现一致性能提升的有效性。代码见 https://github.com/xianlin7/ConvFormer。

关键词

引用

@article{arxiv.2309.05674,
  title  = {ConvFormer: Plug-and-Play CNN-Style Transformers for Improving Medical Image Segmentation},
  author = {Xian Lin and Zengqiang Yan and Xianbo Deng and Chuansheng Zheng and Li Yu},
  journal= {arXiv preprint arXiv:2309.05674},
  year   = {2023}
}

备注

Accepted by MICCAI 2023