中文

面向胸部X光片自动肺炎检测的Vision Transformer与传统深度学习方法比较分析

图像与视频处理 2025-07-16 v1 人工智能 计算机视觉与模式识别 神经与进化计算

摘要

肺炎,尤其是由如新冠病毒等疾病引起的肺炎,仍是全球健康挑战的关键问题,要求快速准确的诊断。本研究对传统机器学习与最新深度学习方法进行全面比较,用于基于胸部X光片(CXR)的自动肺炎检测。我们评估了多种方法, ranging 从常规机器学习技术(基于主成分分析的聚类、逻辑回归和支持向量分类)到先进的深度学习架构,包括卷积神经网络(修改版LeNet、DenseNet-121)以及各种Vision Transformer(ViT)实现(Deep-ViT、紧凑型卷积转换器、Cross-ViT)。我们使用5,856幅儿童CXR图像的数据集,展示了Vision Transformer,特别是Cross-ViT架构,实现了更高的性能,准确率为88.25%,召回率为99.42%,超越了传统CNN方法。我们的分析表明,架构选择对性能影响远大于模型大小,Cross-ViT的7500万参数模型反而超过了更大的模型。该研究还 addresses practical considerations 包括计算效率、训练要求以及医学诊断中精度与召回率之间的关键平衡。我们的发现表明,Vision Transformer为自动肺炎检测提供了有前景的方向,potentially 在卫生危机期间实现更快速和准确的诊断。

关键词

引用

@article{arxiv.2507.10589,
  title  = {Comparative Analysis of Vision Transformers and Traditional Deep Learning Approaches for Automated Pneumonia Detection in Chest X-Rays},
  author = {Gaurav Singh},
  journal= {arXiv preprint arXiv:2507.10589},
  year   = {2025}
}