ConvTransSeg:一种用于医学图像分割的多分辨率卷积-Transformer 网络
计算机视觉与模式识别
2025-03-31 v1 机器学习
摘要
卷积神经网络(CNNs)因能提取高度复杂的特征表示,在医学图像分割中取得了最先进的性能。然而,近期研究指出传统 CNNs 缺乏捕捉不同图像区域间长程依赖的能力。随着 Transformer 模型在自然语言处理任务上的成功,医学图像分割领域也因 Transformer 捕捉长程上下文信息的能力而日益关注其应用。然而,与 CNNs 不同,Transformers 缺乏学习局部特征表示的能力。因此,为充分利用 CNNs 与 Transformers 两者的优势,我们提出一种混合编码器-解码器分割模型(ConvTransSeg)。其由多层 CNN 作为特征学习的编码器,以及相应的多级 Transformer 作为分割预测的解码器构成。编码器与解码器以多分辨率方式互联。我们在二值与多类图像分割任务上,使用多个公开医学图像数据集(包括皮肤病变、息肉、细胞与脑组织的图像)将我们的方法与许多其他最先进的混合 CNN 与 Transformer 分割模型进行比较。实验结果表明,就 Dice 系数与平均对称表面距离度量而言,我们的方法以低模型复杂度和内存消耗取得了总体最佳性能。与我们比较的大多数基于 Transformer 的方法不同,我们的方法无需使用预训练模型即可取得相似或更佳性能。代码已免费发布于 Github 供研究使用:(链接将在接收后添加)。
引用
@article{arxiv.2210.07072,
title = {ConvTransSeg: A Multi-resolution Convolution-Transformer Network for Medical Image Segmentation},
author = {Zhendi Gong and Andrew P. French and Guoping Qiu and Xin Chen},
journal= {arXiv preprint arXiv:2210.07072},
year = {2025}
}
备注
12 pages, 5 figures, 4 tables, also submitted to IEEE-TMI