中文

Swin Transformer的自监督模态无关预训练

计算机视觉与模式识别 2024-05-22 v1 机器学习

摘要

无监督预训练已成为一种变革性范式,在各个领域展现出显著进步。然而,预训练数据分布与微调数据分布存在差异的领域偏移敏感性构成了重大障碍。为解决此问题,我们扩展了Swin Transformer以从不同医学成像模态中学习,从而增强下游性能。我们提出的模型名为SwinFUSE(用于无监督增强的Swin多模态融合,Swin Multi-Modal Fusion for UnSupervised Enhancement),具有三个关键优势:(i) 在预训练期间同时学习计算机断层扫描(CT)和磁共振图像(MRI),产生互补的特征表示;(ii) 域不变性模块(DIM)有效突出显著输入区域,增强适应性;(iii) 展现出显著的泛化能力,超越其初始预训练任务的局限。我们在两个公开可用的3D分割数据集上的实验表明,与单模态模型相比存在1-2%的轻微性能折损,但在分布外模态上却实现了高达27%的显著性能提升。这一实质性改进凸显了我们提出方法的实际相关性与现实适用性。代码可在:https://github.com/devalab/SwinFUSE 获取

关键词

引用

@article{arxiv.2405.12781,
  title  = {Self-Supervised Modality-Agnostic Pre-Training of Swin Transformers},
  author = {Abhiroop Talasila and Maitreya Maity and U. Deva Priyakumar},
  journal= {arXiv preprint arXiv:2405.12781},
  year   = {2024}
}