MiM:面向3D医学图像分析的掩码在掩码自监督预训练
计算机视觉与模式识别
2025-01-13 v2
摘要
Vision Transformer(ViT)在3D医学图像分析的自监督学习中展现出卓越性能。掩码自动编码器(MAE)可进一步发挥ViT在various医学视觉任务中的潜力。然而,由于3D医学图像具有大尺寸空间和更高维度,缺乏层次化设计可能阻碍下游任务的性能。本文提出一种新型\textit{掩码在掩码(MiM)}预训练框架,用于3D医学图像,旨在通过在不同尺度上学习基于层次化视觉token的判别性表征来推动MAE。我们引入多级粒度的掩码输入体积,然后在细粒度和粗粒度水平同时进行重构。此外,应用跨层次对齐机制于相邻层次体积,以在层次化方式强制解剖相似性。我们采用混合主干网络在预训练期间高效地增强层次化表征学习。MiM在大规模可获得3D体积图像上进行预训练,即包含various身体部位的CT图像。13个公开数据集上的广泛实验表明,MiM在器官/病灶/肿瘤分割和疾病分类方面优于其他自监督学习方法。我们进一步将MiM扩展至超过1万体积的大规模预训练数据集,表明大规模预训练可进一步提升下游任务的性能。该研究还表明,针对3D医学图像的健康照护基础模型,研究社区应更关注预训练数据集的规模。
引用
@article{arxiv.2404.15580,
title = {MiM: Mask in Mask Self-Supervised Pre-Training for 3D Medical Image Analysis},
author = {Jiaxin Zhuang and Linshan Wu and Qiong Wang and Peng Fei and Varut Vardhanabhuti and Lin Luo and Hao Chen},
journal= {arXiv preprint arXiv:2404.15580},
year = {2025}
}
备注
submitted to a journal, updated v2