Patcher:基于混合专家补丁Transformer的精确医学图像分割
图像与视频处理
2023-05-31 v2 计算机视觉与模式识别
摘要
我们提出一种新的编码器-解码器视觉Transformer架构 Patcher,用于医学图像分割。与标准视觉Transformer不同,它采用 Patcher 块将图像分割为大补丁,每个大补丁进一步划分为小补丁。Transformer 应用于大补丁内的小补丁,从而约束每个像素的 receptive field(感受野)。我们刻意使大补丁重叠以增强补丁内通信。编码器采用逐级增大感受野的 Patcher 块级联,从局部到全局提取特征。该设计使 Patcher 既能受益于 CNN 中常见的由粗到细特征提取,又能利用 Transformer 优越的空间关系建模能力。我们还提出一种基于混合专家(MoE)的新解码器,将编码器的特征图视为专家,并为每个像素选择合适的专家特征集合以预测标签。MoE 的使用实现了专家特征的更好专门化,并减少了推理期间它们之间的干扰。大量实验表明,Patcher 在卒中病灶分割与息肉分割上显著优于最先进的基于 Transformer 和 CNN 的方法。Patcher 代码随发表公开以促进未来研究。
引用
@article{arxiv.2206.01741,
title = {Patcher: Patch Transformers with Mixture of Experts for Precise Medical Image Segmentation},
author = {Yanglan Ou and Ye Yuan and Xiaolei Huang and Stephen T. C. Wong and John Volpi and James Z. Wang and Kelvin Wong},
journal= {arXiv preprint arXiv:2206.01741},
year = {2023}
}
备注
MICCAI 2022