3D UX-Net:以大型核体卷积网络现代化分层 Transformer 用于医学图像分割
摘要
近期的 3D 医学 ViT(如 SwinUNETR)在包括 3D 医学图像分割在内的多个 3D 体数据基准上取得了最先进的性能。分层 transformer(如 Swin Transformer)重新引入了若干 ConvNet 先验,并进一步增强了在 3D 医学数据集中适配体分割的实际可行性。混合方法的有效性很大程度上归功于非局部自注意力的大感受野以及大量的模型参数。在本工作中,我们提出了一种轻量级体卷积网络,称为 3D UX-Net,它使用 ConvNet 模块适配分层 transformer 以实现鲁棒的体分割。具体而言,受 Swin Transformer 启发,我们重新审视了具有大核尺寸(如从 开始)的体深度可分离卷积,以实现更大的全局感受野。我们进一步将 Swin Transformer 块中的多层感知机(MLP)替换为逐点深度卷积,并通过更少的归一化与激活层来增强模型性能,从而减少了模型参数数量。3D UX-Net 在使用三个具有挑战性的脑与腹部体成像公开数据集上与当前 SOTA transformer(如 SwinUNETR)展开了有力竞争:1) MICCAI Challenge 2021 FLARE,2) MICCAI Challenge 2021 FeTA,以及 3) MICCAI Challenge 2022 AMOS。3D UX-Net 持续优于 SwinUNETR,Dice 系数从 0.929 提升至 0.938(FLARE2021)以及从 0.867 提升至 0.874(Feta2021)。我们进一步用 AMOS2022 评估了 3D UX-Net 的迁移学习能力,并展示了 Dice 系数额外提升 (从 0.880 到 0.900)。我们提出的模型源代码可在 https://github.com/MASILab/3DUX-Net 获取。
引用
@article{arxiv.2209.15076,
title = {3D UX-Net: A Large Kernel Volumetric ConvNet Modernizing Hierarchical Transformer for Medical Image Segmentation},
author = {Ho Hin Lee and Shunxing Bao and Yuankai Huo and Bennett A. Landman},
journal= {arXiv preprint arXiv:2209.15076},
year = {2023}
}
备注
Accepted to ICLR 2023