视觉Transformer与卷积神经网络在医学图像分类中的比较分析
图像与视频处理
2025-07-30 v1 计算机视觉与模式识别
机器学习
摘要
视觉Transformer(ViT)的出现彻底改变了计算机视觉,但与传统卷积神经网络(CNN)相比,其在医学影像中的有效性仍有待探索。本研究对CNN和ViT架构在三个关键的医学影像任务上进行了全面的比较分析:胸部X光肺炎检测、脑肿瘤分类和皮肤癌黑色素瘤检测。我们评估了四种最先进的模型——ResNet-50、EfficientNet-B0、ViT-Base和DeiT-Small——在总计8,469张医学图像的数据集上。我们的结果显示了特定任务的模型优势:ResNet-50在胸部X光分类上达到了98.37%的准确率,DeiT-Small在脑肿瘤检测上以92.16%的准确率表现出色,而EfficientNet-B0在皮肤癌分类上以81.84%的准确率领先。这些发现为从业者为医学AI应用选择架构提供了关键见解,强调了在临床决策支持系统中进行特定任务架构选择的重要性。
引用
@article{arxiv.2507.21156,
title = {Comparative Analysis of Vision Transformers and Convolutional Neural Networks for Medical Image Classification},
author = {Kunal Kawadkar},
journal= {arXiv preprint arXiv:2507.21156},
year = {2025}
}
备注
9 pages, 8 figures, 3 tables. Submitted to IEEE Access