用于精准生物医学图像分割的多重复 Transformer
计算机视觉与模式识别
2021-06-29 v1
摘要
近期的视觉 transformer(即用于图像分类者)学习了不同图像块 token 的非局部注意力交互。然而,先前工作忽略了学习不同像素的跨尺度依赖、不同标签的语义对应,以及特征表示与语义嵌入的一致性,而这些对生物医学分割至关重要。在本文中,我们通过提出一个统一的 transformer 网络,称为多重复 Transformer(MCTrans),来解决上述问题,其将丰富的特征学习与语义结构挖掘纳入统一框架。具体而言,MCTrans 将多尺度卷积特征嵌入为 token 序列,并执行尺度内与尺度间自注意力,而非先前工作中的单尺度注意力。此外,还引入了一个可学习的代理嵌入,分别通过自注意力和交叉注意力来建模语义关系与特征增强。MCTrans 可轻松插入类 UNet 网络中,并在六个标准基准的生物医学图像分割上显著优于最先进方法。例如,MCTrans 在 Pannuke、CVC-Clinic、CVC-Colon、Etis、Kavirs、ISIC2018 数据集上分别超越 UNet 达 3.64%、3.71%、4.34%、2.8%、1.88%、1.57%。代码见 https://github.com/JiYuanFeng/MCTrans。
引用
@article{arxiv.2106.14385,
title = {Multi-Compound Transformer for Accurate Biomedical Image Segmentation},
author = {Yuanfeng Ji and Ruimao Zhang and Huijie Wang and Zhen Li and Lingyun Wu and Shaoting Zhang and Ping Luo},
journal= {arXiv preprint arXiv:2106.14385},
year = {2021}
}
备注
Accepted by MICCAI2021