面向胸部X光片自动肺炎检测的Vision Transformer与传统深度学习方法比较分析
图像与视频处理
2025-07-16 v1 人工智能
计算机视觉与模式识别
神经与进化计算
摘要
肺炎,尤其是由如新冠病毒等疾病引起的肺炎,仍是全球健康挑战的关键问题,要求快速准确的诊断。本研究对传统机器学习与最新深度学习方法进行全面比较,用于基于胸部X光片(CXR)的自动肺炎检测。我们评估了多种方法, ranging 从常规机器学习技术(基于主成分分析的聚类、逻辑回归和支持向量分类)到先进的深度学习架构,包括卷积神经网络(修改版LeNet、DenseNet-121)以及各种Vision Transformer(ViT)实现(Deep-ViT、紧凑型卷积转换器、Cross-ViT)。我们使用5,856幅儿童CXR图像的数据集,展示了Vision Transformer,特别是Cross-ViT架构,实现了更高的性能,准确率为88.25%,召回率为99.42%,超越了传统CNN方法。我们的分析表明,架构选择对性能影响远大于模型大小,Cross-ViT的7500万参数模型反而超过了更大的模型。该研究还 addresses practical considerations 包括计算效率、训练要求以及医学诊断中精度与召回率之间的关键平衡。我们的发现表明,Vision Transformer为自动肺炎检测提供了有前景的方向,potentially 在卫生危机期间实现更快速和准确的诊断。
引用
@article{arxiv.2507.10589,
title = {Comparative Analysis of Vision Transformers and Traditional Deep Learning Approaches for Automated Pneumonia Detection in Chest X-Rays},
author = {Gaurav Singh},
journal= {arXiv preprint arXiv:2507.10589},
year = {2025}
}