SwinMM:基于 Swin Transformers 的掩码多视图三维医学图像分割
计算机视觉与模式识别
2023-07-25 v1
摘要
大规模 Vision Transformers 的近期进展在改进医学图像分割预训练模型方面取得了显著进步。然而,这些方法在获取大量预训练数据方面面临显著挑战,尤其在医学领域。为应对此限制,我们提出 Masked Multi-view with Swin Transformers(SwinMM),一种用于实现准确且数据高效的自监督医学图像分析的新颖多视图流程。我们的策略通过两个主要组件来利用多视图信息的潜力。在预训练阶段,我们部署一种掩码多视图编码器,旨在通过一系列多样的代理任务同时训练掩码多视图观测。这些任务涵盖图像重建、旋转、对比学习,以及一种采用互学习范式的新颖任务。该新任务利用来自不同视角预测之间的一致性,从三维医学数据中提取隐藏的多视图信息。在微调阶段,开发了一种跨视图解码器,通过交叉注意力块聚合多视图信息。与先前最先进的自监督学习方法 Swin UNETR 相比,SwinMM 在若干医学图像分割任务上展现出明显优势。它实现了多视图信息的平滑融合,显著提升了模型的准确性与数据效率。代码与模型见 https://github.com/UCSC-VLAA/SwinMM/。
引用
@article{arxiv.2307.12591,
title = {SwinMM: Masked Multi-view with Swin Transformers for 3D Medical Image Segmentation},
author = {Yiqing Wang and Zihan Li and Jieru Mei and Zihao Wei and Li Liu and Chen Wang and Shengtian Sang and Alan Yuille and Cihang Xie and Yuyin Zhou},
journal= {arXiv preprint arXiv:2307.12591},
year = {2023}
}
备注
MICCAI 2023; project page: https://github.com/UCSC-VLAA/SwinMM/