用于三维医学图像分析的自监督预训练 Swin Transformer
计算机视觉与模式识别
2022-03-29 v2 人工智能
机器学习
摘要
视觉 Transformer(ViT)在可迁移至下游应用的全局与局部表示的自监督学习中已展现出优异性能。受这些结果启发,我们引入了一种新颖的、带有量身定制代理任务的自监督学习框架,用于医学图像分析。具体而言,我们提出:(i)一个新的基于三维 transformer 的模型,称为 Swin UNEt TRansformers(Swin UNETR),其带有用于自监督预训练的层次化编码器;(ii)用于学习人体解剖学潜在模式的量身定制代理任务。我们展示了所提模型在来自不同身体器官的 5,050 张公开可用计算机断层扫描(CT)图像上的成功预训练。我们方法的有效性通过在 Beyond the Cranial Vault(BTCV)分割挑战(含 13 个腹部器官)和来自 Medical Segmentation Decathlon(MSD)数据集的分割任务上微调预训练模型得到验证。我们的模型目前是 MSD 和 BTCV 数据集公开测试排行榜上的最优(即排名第 1)。代码:https://monai.io/research/swin-unetr
引用
@article{arxiv.2111.14791,
title = {Self-Supervised Pre-Training of Swin Transformers for 3D Medical Image Analysis},
author = {Yucheng Tang and Dong Yang and Wenqi Li and Holger Roth and Bennett Landman and Daguang Xu and Vishwesh Nath and Ali Hatamizadeh},
journal= {arXiv preprint arXiv:2111.14791},
year = {2022}
}
备注
CVPR'22 Accepted Paper