中文

AdaViT:面向可变 3D 医学图像模态的自适应视觉 Transformer 及其灵活预训练与微调

图像与视频处理 2025-04-07 v1 计算机视觉与模式识别

摘要

预训练技术(无论是有监督还是自监督)在深度学习中被广泛用于提升模型性能。在真实临床场景中,不同受试者/病例通常会采集不同的磁共振(MR)对比序列,这给假设所有病例以及预训练与微调之间输入模态一致的深度学习模型带来了挑战。当输入模态/对比序列集合与预训练模型不匹配时,现有方法难以维持性能,往往导致精度下降。我们提出了一种自适应视觉 Transformer(AdaViT)框架,能够处理每个病例的可变输入模态集合。我们利用动态分词器将不同的输入图像模态编码为 token,并借助 Transformer 的特性在可变长度的 token 之间构建注意力机制。通过大量实验,我们证明该架构能够有效地将监督预训练模型迁移到具有不同输入模态/对比序列集合的新数据集上,在脑梗死与脑肿瘤分割任务的零样本测试、少样本微调以及反向迁移中均取得了优异性能。此外,在自监督预训练方面,所提方法能够最大化预训练数据的使用,并促进向具有可变输入模态集合的多样化下游任务的迁移。

关键词

引用

@article{arxiv.2504.03589,
  title  = {AdaViT: Adaptive Vision Transformer for Flexible Pretrain and Finetune with Variable 3D Medical Image Modalities},
  author = {Badhan Kumar Das and Gengyan Zhao and Han Liu and Thomas J. Re and Dorin Comaniciu and Eli Gibson and Andreas Maier},
  journal= {arXiv preprint arXiv:2504.03589},
  year   = {2025}
}