中文

Primus:用于 3D 医学图像分割的注意力使用强制机制

计算机视觉与模式识别 2026-05-01 v2

摘要

Transformer 在多个领域取得了显著的成功,但其在 3D 医学图像分割中的影响仍有限,卷积网络仍主导主要基准。本文中,我们(A)分析当前基于 Transformer 的分割模型,识别出关键短板,特别是其对卷积模块的过度依赖。进一步我们展示,在某些体系结构中,缺少 Transformer 块时性能不受影响,从而表明其有效性有限。为解决这些挑战,我们摆脱混合体系结构,(B)引入基于 Transformer 的分割体系结构,称为 Primus 和 PrimusV2。Primus 利用高分辨率标记,结合位置嵌入和块设计的最新进展,以充分发挥 Transformer 块的潜力,而 PrimusV2 则通过迭代 patch 嵌入进行扩展。通过这些改编,Primus 超越了当前基于 Transformer 的方法,并与默认的 nnU-Net 竞争,而 PrimusV2 超过 nnU-Net,与 ResEnc-L 和 MedNeXt 等最先进的 CNN 体系结构相当,这些体系结构跨越了九个公开数据集。在此过程中,我们引入了首个在 3D 医学图像分割中具有竞争力的基于 Transformer 的模型,使 Transformer 成为该领域的最先进技术。代码可在此处获取:https://github.com/MIC-DKFZ/nnUNet/blob/master/documentation/primus.md。

关键词

引用

@article{arxiv.2503.01835,
  title  = {Primus: Enforcing Attention Usage for 3D Medical Image Segmentation},
  author = {Tassilo Wald and Saikat Roy and Fabian Isensee and Constantin Ulrich and Sebastian Ziegler and Dasha Trofimova and Raphael Stock and Michael Baumgartner and Gregor Köhler and Klaus Maier-Hein},
  journal= {arXiv preprint arXiv:2503.01835},
  year   = {2026}
}

备注

Accepted in Transactions on Machine Learning Research (TMLR)