通过权重膨胀将预训练视觉Transformer从2D适配到3D以提升医学图像分割
计算机视觉与模式识别
2023-02-10 v1
摘要
鉴于MRI和CT等3D医学成像技术广泛用于诊断和治疗的多种疾病,3D分割是医学图像分析的基本任务之一。近来,基于Transformer的模型通过在大规模自然图像基准数据集上预训练,已在许多视觉任务中取得最先进的性能。尽管医学图像分析方面的工作也开始探索基于Transformer的模型,但目前尚无有效利用预训练Transformer的最优策略,主要由于2D自然图像与3D医学图像在维度上的差异。现有方案要么将3D图像拆分为2D切片并独立预测每个切片,从而丢失关键的深度信息,要么修改Transformer架构以支持3D输入而不利用预训练权重。在本工作中,我们采用简单而有效的权重膨胀策略将预训练Transformer从2D适配到3D,同时保留迁移学习和深度信息的优势。我们进一步研究了从不同预训练来源和目标进行迁移的有效性。我们的方法在广泛的3D医学图像数据集上取得最先进的性能,并可成为基于Transformer的3D医学图像所有工作轻松采用的标准策略,以最大化性能。
引用
@article{arxiv.2302.04303,
title = {Adapting Pre-trained Vision Transformers from 2D to 3D through Weight Inflation Improves Medical Image Segmentation},
author = {Yuhui Zhang and Shih-Cheng Huang and Zhengping Zhou and Matthew P. Lungren and Serena Yeung},
journal= {arXiv preprint arXiv:2302.04303},
year = {2023}
}
备注
Published at ML4H 2022