3D TransUNet:通过视觉 Transformer 推进医学图像分割
计算机视觉与模式识别
2023-10-13 v1
摘要
医学图像分割在推进疾病诊断与治疗规划的健康系统中起着关键作用。被称为 U-Net 的 u 形架构已证明对各种医学图像分割任务极为成功。然而,U-Net 基于卷积的操作固有地限制了其有效建模长程依赖的能力。为应对这些局限,研究者已转向以全局自注意力机制闻名的 Transformer 作为替代架构。一个流行的网络是我们先前的 TransUNet,其利用 Transformer 的自注意力以全局上下文补充 U-Net 的局部信息。在本文中,我们基于最先进的 nnU-Net 架构将 2D TransUNet 架构扩展为 3D 网络,并充分探索 Transformer 在编码器与解码器设计中的潜力。我们引入两个关键组件:1)一个 Transformer 编码器,其从卷积神经网络(CNN)特征图对图像块进行分词,从而实现全局上下文的提取;2)一个 Transformer 解码器,其通过利用候选提议与 U-Net 特征之间的交叉注意力自适应地细化候选区域。我们的研究表明,不同的医学任务受益于不同的架构设计。Transformer 编码器在多器官分割中表现出色,其中器官间关系至关重要。另一方面,Transformer 解码器被证明更利于处理如肿瘤分割等小而具挑战性的分割目标。大量实验展示了将基于 Transformer 的编码器与解码器整合进 u 形医学图像分割架构的显著潜力。TransUNet 在各种医学应用中优于竞争者。
引用
@article{arxiv.2310.07781,
title = {3D TransUNet: Advancing Medical Image Segmentation through Vision Transformers},
author = {Jieneng Chen and Jieru Mei and Xianhang Li and Yongyi Lu and Qihang Yu and Qingyue Wei and Xiangde Luo and Yutong Xie and Ehsan Adeli and Yan Wang and Matthew Lungren and Lei Xing and Le Lu and Alan Yuille and Yuyin Zhou},
journal= {arXiv preprint arXiv:2310.07781},
year = {2023}
}
备注
Code and models are available at https://github.com/Beckschen/3D-TransUNet