SSL 预训练向相同与不同模态分割任务迁移性的基准测试
计算机视觉与模式识别
2026-05-19 v1
摘要
方法:使用涵盖不同疾病部位的相同 10{,}412 个 3D CT 扫描(1.89~M 个 2D 轴向切片),从头预训练了跨越四个前置任务家族的九种 SSL 方法。将每种方法的预训练 Swin Transformer 编码器集成到 SwinUNETR 风格的分割网络(带有 3D CNN 解码器和跳跃连接的 Swin 编码器)中,并在九个不同复杂度的公开分割任务上进行微调,包括腹部大器官、头颈部结构以及来自 CT 和 MRI 的肿瘤。使用 Dice 相似系数(DSC)评估性能。使用中心化核对齐进一步分析了微调收敛速度、跨模态(CT 到 MRI)的迁移性以及少样本与多样本微调之间的特征重用模式。结果:自蒸馏掩码图像变换器(SMIT)结合了掩码图像建模(MIM)与局部和全局自蒸馏,在九个任务中取得了最高的总体分割精度、最快的微调收敛速度和最小的少样本到多样本性能差距,表明其具有最强的数据效率。SMIT 还在少样本和多样本微调之间表现出最一致的特征重用模式。基于 MIM 的 SimMIM 和自蒸馏方法(DINO、iBOT)优于依赖图像级全局表示的对比学习和旋转预测。SSL 方法之间的差异在少样本设置下最大,随着标注微调数据集规模的增加而缩小,表明 SSL 预训练的选择在标注预算有限时最为重要。
引用
@article{arxiv.2605.18491,
title = {Benchmarking transferability of SSL pretraining to same and different modality segmentation tasks},
author = {Jue Jiang and Harini Veeraraghavan},
journal= {arXiv preprint arXiv:2605.18491},
year = {2026}
}
备注
Paper submitted to Medical Physics for review