DeformUX-Net:以深度可变形卷积探索用于医学图像分割的三维基础骨干网络
计算机视觉与模式识别
2023-10-05 v2
摘要
3D ViT 在医学图像分割中的应用已取得显著进展,在一定程度上掩盖了基于卷积神经网络(CNN)模型的崭露头角。大核深度卷积已成为一种有前景的技术,展现出类似于分层 transformer 的能力,并促进了对于密集预测至关重要的广阔有效感受野(ERF)。尽管如此,从全局-局部注意力到大核卷积的现有核心算子都表现出固有的权衡与局限(例如,全局-局部范围权衡、聚合注意力特征)。我们假设可变形卷积可作为一种探索性替代方案,结合先前算子的所有优势,提供长程依赖、自适应空间聚合与计算效率,作为基础骨干。本工作中,我们引入 3D DeformUX-Net,一种开创性的体素 CNN 模型,巧妙规避了传统上与 ViT 和大核卷积相关的缺陷。具体而言,我们重新审视深度设置下的体素可变形卷积,以计算效率适应长程依赖。受卷积核权重结构重参数化概念启发,我们进一步通过适配一个并行分支(从 卷积起始)生成可变形三平面偏移,提供跨所有信道的自适应空间聚合。我们的经验评估显示,3D DeformUX-Net 在四个具挑战性的公开数据集上持续优于现有最先进的 ViT 和大核卷积模型,涵盖从器官(KiTS:0.680 至 0.720,MSD Pancreas:0.676 至 0.717,AMOS:0.871 至 0.902)到血管(如 MSD 肝血管:0.635 至 0.671)不同尺度的平均 Dice。
引用
@article{arxiv.2310.00199,
title = {DeformUX-Net: Exploring a 3D Foundation Backbone for Medical Image Segmentation with Depthwise Deformable Convolution},
author = {Ho Hin Lee and Quan Liu and Qi Yang and Xin Yu and Shunxing Bao and Yuankai Huo and Bennett A. Landman},
journal= {arXiv preprint arXiv:2310.00199},
year = {2023}
}
备注
14 pages, the source code with our pre-trained model is available at this https://github.com/MASILab/deform-uxnet