基于自蒸馏掩码图像Transformer (SMIT) 的自监督三维解剖结构分割
图像与视频处理
2022-09-27 v1 计算机视觉与模式识别
摘要
视觉Transformer因其更高效建模长程上下文的能力,已在包括分割在内的若干计算机视觉与医学图像分析任务中展现出令人印象深刻的精度提升。然而,此类方法需要大规模标注数据集进行训练,而这在医学图像分析中难以获取。自监督学习(SSL)已在使用卷积网络的医学图像分割中取得成功。本工作中,我们提出了一种结合掩码图像建模的自蒸馏学习方法,用于对视觉Transformer(SMIT)执行SSL,应用于CT与MRI的3D多器官分割。我们的贡献是在掩码块内称为掩码图像预测的密集像素级回归,并将其与掩码块令牌蒸馏作为预训练视觉Transformer的代理任务相结合。我们表明,与其他代理任务相比,我们的方法更准确且需要更少的微调数据集。与先前通常使用来自与目标任务对应的疾病部位和成像模态的图像集的医学图像方法不同,我们使用了来自头颈、肺和肾癌以及COVID-19的3643例CT扫描(602,708幅图像)进行预训练,并将其应用于MRI胰腺癌患者的腹部器官分割以及公开可用的CT上13种不同腹部器官分割。我们的方法显示出明确的精度提升(MRI平均DSC为0.875,CT为0.878),且相较于常用代理任务降低了对微调数据集的需求。我们与多种当前SSL方法进行了广泛比较。代码将在接受发表后公开。
引用
@article{arxiv.2205.10342,
title = {Self-supervised 3D anatomy segmentation using self-distilled masked image transformer (SMIT)},
author = {Jue Jiang and Neelam Tyagi and Kathryn Tringale and Christopher Crane and Harini Veeraraghavan},
journal= {arXiv preprint arXiv:2205.10342},
year = {2022}
}
备注
This paper has been early accepted by MICCAI 2022