一种计算机视觉混合方法:用于从脑部MRI扫描中精确检测阿尔茨海默病的CNN与Transformer模型
计算机视觉与模式识别
2026-01-22 v1
摘要
从脑部MRI扫描中对阿尔茨海默病(AD)进行早期且准确的分类,对于及时的临床干预和改善患者预后至关重要。本研究对五种CNN架构(EfficientNetB0、ResNet50、DenseNet201、MobileNetV3、VGG16)、五种基于Transformer的模型(ViT、ConvTransformer、PatchTransformer、MLP-Mixer、SimpleTransformer)以及一种名为Evan_V2的混合模型进行了全面的比较分析。所有模型均在包含轻度痴呆、中度痴呆、非痴呆和极轻度痴呆类别的四分类AD分类任务上进行了评估。实验结果表明,CNN架构持续表现出强劲性能,其中ResNet50达到了98.83%的准确率。Transformer模型展示了有竞争力的泛化能力,其中ViT以95.38%的准确率在其中最高。然而,单个Transformer变体表现出更大的类别特异性不稳定性。所提出的Evan_V2混合模型通过特征级融合整合了十个CNN和Transformer架构的输出,取得了最佳整体性能,准确率达到99.99%,F1分数为0.9989,ROC AUC为0.9968。混淆矩阵分析进一步证实,Evan_V2显著减少了所有痴呆阶段的错误分类,优于每一个独立模型。这些发现突显了混合集成策略在生成高度可靠且具有临床意义的阿尔茨海默病分类诊断工具方面的潜力。
引用
@article{arxiv.2601.15202,
title = {A Computer Vision Hybrid Approach: CNN and Transformer Models for Accurate Alzheimer's Detection from Brain MRI Scans},
author = {Md Mahmudul Hoque and Shuvo Karmaker and Md. Hadi Al-Amin and Md Modabberul Islam and Jisun Junayed and Farha Ulfat Mahi},
journal= {arXiv preprint arXiv:2601.15202},
year = {2026}
}