中文

基于残差视觉 Transformer (ResViT) 的脑肿瘤分类自监督学习模型

图像与视频处理 2024-11-21 v1 计算机视觉与模式识别 机器学习

摘要

深度学习已被证明在脑肿瘤诊断的 MRI 解读中极具前景。然而,深度学习模型受限于缺乏用于有效训练的脑 MRI 数据集。自监督学习(SSL)模型为有限数据集问题提供了数据高效且显著的解决方案。因此,本文引入了一个两阶段的生成式 SSL 模型用于脑肿瘤分类。第一阶段旨在预训练残差视觉 Transformer (ResViT) 模型,以 MRI 合成作为前置任务。第二阶段包括将基于 ResViT 的分类器模型作为下游任务进行微调。为此,我们旨在通过 CNN 利用局部特征,通过 ViT 利用全局特征,在前置和下游任务中为 ResViT 采用混合 CNN-transformer 架构。此外,利用合成的 MRI 图像来平衡训练集。所提出的模型在公开的 BraTs 2023、Figshare 和 Kaggle 数据集上进行了测试。此外,我们将所提出的模型与各种深度学习模型进行了比较,包括用于 MRI 合成的 A-UNet、ResNet-9、pix2pix、pGAN,以及用于分类的 ConvNeXtTiny、ResNet101、DenseNet12、Residual CNN、ViT。结果表明,在 MRI 数据集上进行预训练的所提模型优于在 ImageNet 数据集上的预训练。总体而言,所提模型获得了最高准确率,在 BraTs 数据集 T1 序列上达到 90.56%,在 Figshare 上达到 98.53%,在 Kaggle 脑肿瘤数据集上达到 98.47%。因此,通过结合 SSL、微调、数据增强以及结合 CNN 和 ViT,所提模型展示了一种处理 MRI 分析中数据集不足挑战的稳健、有效且成功的方法。

关键词

引用

@article{arxiv.2411.12874,
  title  = {Residual Vision Transformer (ResViT) Based Self-Supervised Learning Model for Brain Tumor Classification},
  author = {Meryem Altin Karagoz and O. Ufuk Nalbantoglu and Geoffrey C. Fox},
  journal= {arXiv preprint arXiv:2411.12874},
  year   = {2024}
}