面向自动脑肿瘤分类的可解释视觉转换器框架
计算机视觉与模式识别
2026-04-24 v1
摘要
脑肿瘤是最关键的神经疾病之一,早期和准确诊断直接相关于患者生存率。手动解读磁共振成像 (MRI) 扫描耗时,受观察者间变异性影响,并需要大量专家知识。本文提出了用于自动四类脑肿瘤分类的深度学习框架,区分肝瘤、脑膜瘤、垂体肿瘤和健康脑组织,从 7023 例 MRI 扫描中实现。该系统采用在 ImageNet-21k 上预训练的视觉转换器 (ViT-B/16) 作为主干网络,并辅以临床动机驱动的预处理和训练管线。应用对比受限自适应直方图均衡化 (CLAHE) 以增强局部对比度,突出标准归一化下不可见的肿瘤边界。采用两阶段微调策略:首先在主干网络冻结的情况下对分类头进行热身训练,然后以判别性学习率进行完整微调。每批次应用 MixUp 和 CutMix 数据增强以提高泛化能力。采用指数移动平均 (EMA) 权重和测试时数据增强 (TTA) 进一步稳定和提升性能。注意力推送可视化提供了解释性热图,揭示驱动每个预测的大脑区域。该模型在测试集上实现了 99.29% 的准确率,宏平均 F1 分数达到 99.25%,在健康脑组织和脑膜瘤类别上实现完美召回率,优于所有基于卷积神经网络的基线模型。
引用
@article{arxiv.2604.21311,
title = {an interpretable vision transformer framework for automated brain tumor classification},
author = {Chinedu Emmanuel Mbonu and Tochukwu Sunday Belonwu and Okwuchukwu Ejike Chukwuogo and Kenechukwu Sylvanus Anigbogu},
journal= {arXiv preprint arXiv:2604.21311},
year = {2026}
}
备注
9 pages, 6 figures