中文

利用空间自适应网络构建医学图像分析的通用基础模型

计算机视觉与模式识别 2024-01-25 v2

摘要

近年来,基础模型(通常通过自监督学习在大规模多样化数据集上训练)在医学图像分析中展现出巨大潜力。然而,由于医学成像数据存在显著的空间异质性,当前模型必须针对不同数据集定制特定结构,这使得利用丰富的无标签数据变得困难。在这项工作中,我们提出了一种用于医学图像分析的通用基础模型,该模型使用统一结构处理具有异质空间特性的图像。为此,我们提出了空间自适应网络(SPAD-Nets),这是一类能够动态调整结构以适应输入图像空间特性的网络家族,用于构建这样的通用基础模型。我们通过掩码图像建模(MIM)在55个公开医学图像数据集上预训练了一个空间自适应视觉分词器(SPAD-VT),然后预训练了一个空间自适应Vision Transformer(SPAD-ViT)。预训练数据包含超过900万张图像切片,据我们所知,这是用于预训练医学图像分析通用基础模型的最大、最全面且最多样化的数据集。在下游医学图像分类和分割任务上的实验结果表明,我们的模型具有优越的性能和标签效率。我们的代码可在https://github.com/function2-llx/PUMIT获取。

关键词

引用

@article{arxiv.2312.07630,
  title  = {Building Universal Foundation Models for Medical Image Analysis with Spatially Adaptive Networks},
  author = {Lingxiao Luo and Xuanzhong Chen and Bingda Tang and Xinsheng Chen and Rong Han and Chengpeng Hu and Yujiang Li and Ting Chen},
  journal= {arXiv preprint arXiv:2312.07630},
  year   = {2024}
}