中文

基于自适应注意力门的 CNN-ViT 混合模型用于脑肿瘤 MRI 分类

计算机视觉与模式识别 2026-04-28 v1 人工智能 定量方法

摘要

早期检测和分类使用磁共振成像(MRI)图像的脑肿瘤具有高度重要性,但在医学图像中难以提取。卷积神经网络(CNN)擅长捕获局部纹理和空间信息,而视觉转换器(ViT)则擅长捕获长程全局依赖关系。本文提出了一种新型混合架构,将基于 SqueezeNet 风格的 CNN 分支与基于 MobileViT 风格的全局转换器分支通过自适应注意力门机制进行融合。该门学习动态的 per-sample、per-feature 权重,以对每个分支的贡献进行加权,从而实现局部与全局表征的上下文敏感融合。本文提出的模型在测试准确率达到 97.60,精确率为 97.30,召回率为 97.50,F1 分数为 97.40,宏平均 AUC 为 0.9946,训练并在脑肿瘤 MRI 数据集(Kaggle)上进行评估。这些分数高于单一 CNN 和 ViT 基线,以及当前竞争性融合方法,表明动态特征加权是分类医学图像的有效方式。

关键词

引用

@article{arxiv.2604.23137,
  title  = {CNN-ViT Fusion with Adaptive Attention Gate for Brain Tumor MRI Classification: A Hybrid Deep Learning Model},
  author = {Syed Ibad Hasnain and Muhammad Faris and Hafiza Syeda Yusra Tirmizi and Rabail Khowaja and Hafsa Israr},
  journal= {arXiv preprint arXiv:2604.23137},
  year   = {2026}
}

备注

9 pages, 4 figures, submitted as conference paper