中文

ScaleFormer:从尺度视角重新审视基于 Transformer 的主干网络用于医学图像分割

计算机视觉与模式识别 2022-08-01 v1

摘要

近来,各类视觉 Transformer 因其建模长程依赖的能力而被提出。在当前用于医学图像分割的基于 Transformer 的主干网络中,卷积层被纯 Transformer 替代,或将 Transformer 添加至最深层编码器以学习全局上下文。然而,从尺度视角看主要存在两个挑战:(1) 尺度内问题:现有方法缺乏在每个尺度中提取局部-全局线索,这可能影响小物体的信号传播;(2) 尺度间问题:现有方法未能从多尺度中挖掘有区分性的信息,这可能阻碍对尺寸、形状和位置变化广泛的物体的表示学习。为应对这些局限,我们提出一种新颖主干网络,即 ScaleFormer,具有两个引人注目的设计:(1) 设计尺度内尺度感知 Transformer,在每个尺度中将基于 CNN 的局部特征与基于 Transformer 的全局线索相耦合,其中行向与列向的全局依赖可由轻量级 Dual-Axis MSA 提取。(2) 设计简洁有效的空间感知尺度间 Transformer,用于多尺度中共识区域间的交互,可突出跨尺度依赖并解决复杂的尺度变化。在不同基准上的实验结果表明,我们的 Scale-Former 优于当前最先进方法。代码公开于:https://github.com/ZJUGiveLab/ScaleFormer。

关键词

引用

@article{arxiv.2207.14552,
  title  = {ScaleFormer: Revisiting the Transformer-based Backbones from a Scale-wise Perspective for Medical Image Segmentation},
  author = {Huimin Huang and Shiao Xie1 and Lanfen Lin and Yutaro Iwamoto and Xianhua Han and Yen-Wei Chen and Ruofeng Tong},
  journal= {arXiv preprint arXiv:2207.14552},
  year   = {2022}
}

备注

Accepted to IJCAI 2022