UNETR:用于三维医学图像分割的 Transformer
图像与视频处理
2021-10-12 v3 计算机视觉与模式识别
机器学习
摘要
过去十年中,具有收缩与扩展路径的全卷积神经网络(FCNNs)在绝大多数医学图像分割应用中表现突出。在 FCNNs 中,编码器通过学习全局与局部特征及上下文表示发挥着不可或缺的作用,这些可由解码器用于语义输出预测。尽管取得成功,FCNNs 中卷积层的局部性限制了学习长程空间依赖的能力。受近期 Transformer 在自然语言处理(NLP)长程序列学习成功的启发,我们将体数据(三维)医学图像分割任务重新表述为序列到序列预测问题。我们引入一种新颖架构,称为 UNet TRansformers(UNETR),其利用 Transformer 作为编码器学习输入体数据的序列表示并有效捕获全局多尺度信息,同时遵循成功的编码器与解码器“U 形”网络设计。Transformer 编码器通过不同分辨率的跳跃连接直接连至解码器以计算最终语义分割输出。我们在 Multi Atlas Labeling Beyond The Cranial Vault(BTCV)数据集上验证了该方法用于多器官分割,以及在 Medical Segmentation Decathlon(MSD)数据集上用于脑肿瘤与脾脏分割任务。我们的基准测试在 BTCV 排行榜上展示了新的最先进性能。代码:https://monai.io/research/unetr
引用
@article{arxiv.2103.10504,
title = {UNETR: Transformers for 3D Medical Image Segmentation},
author = {Ali Hatamizadeh and Yucheng Tang and Vishwesh Nath and Dong Yang and Andriy Myronenko and Bennett Landman and Holger Roth and Daguang Xu},
journal= {arXiv preprint arXiv:2103.10504},
year = {2021}
}
备注
Accepted to IEEE Winter Conference on Applications of Computer Vision (WACV) 2022