Cats:用于分割的互补 CNN 与 Transformer 编码器
图像与视频处理
2022-08-25 v1 计算机视觉与模式识别
摘要
近年来,深度学习方法在许多医学图像分割任务中取得了最先进的性能。其中许多基于卷积神经网络(CNN)。对于此类方法,编码器是从输入图像中提取全局与局部信息的关键部分;提取的特征随后被传递给解码器以预测分割结果。相反,若干近期工作表明使用 transformer 可获得更优性能,其能更好地建模长程空间依赖并捕捉低层细节。然而,仅以 transformer 作为编码器在某些任务上表现不佳,无法有效替代基于卷积的编码器。本文中,我们提出一种具有双编码器的模型用于三维生物医学图像分割。我们的模型是一个 U 形 CNN,并增配一个独立的 transformer 编码器。我们将卷积编码器与 transformer 的信息融合,并传递给解码器以得到结果。我们在来自三个不同挑战的三个公开数据集上评估了我们的方法:BTCV、MoDA 和 Decathlon。与各项任务上含或不含 transformer 的现有最先进模型相比,我们提出的方法在所有情况下均获得了更高的 Dice 分数。
引用
@article{arxiv.2208.11572,
title = {Cats: Complementary CNN and Transformer Encoders for Segmentation},
author = {Hao Li and Dewei Hu and Han Liu and Jiacheng Wang and Ipek Oguz},
journal= {arXiv preprint arXiv:2208.11572},
year = {2022}
}