CNN、ResNet与Vision Transformer在胸部疾病多分类中的比较研究
图像与视频处理
2024-06-04 v1 计算机视觉与模式识别
机器学习
摘要
大型语言模型,特别是利用Transformer架构的模型,因其可扩展性和处理大量数据的能力而成为强大的工具。Dosovitskiy等人扩展了该架构,引入了Vision Transformer(ViT),将其适用性扩展到图像处理任务。受此进展的推动,我们使用包含超过10万张正面X光图像的NIH胸部X光数据集,对两种ViT模型变体进行了微调:一种在ImageNet上预训练,另一种从头开始训练。本研究评估了这些模型在14种不同疾病的多标签分类中的性能,并以卷积神经网络(CNN)和ResNet架构作为基线模型进行比较。通过基于准确率指标的严格评估,我们发现预训练的ViT模型在此多标签分类任务中优于CNN和ResNet,突显了其在从胸部X光图像中准确诊断各种肺部疾病方面的潜力。
引用
@article{arxiv.2406.00237,
title = {A Comparative Study of CNN, ResNet, and Vision Transformers for Multi-Classification of Chest Diseases},
author = {Ananya Jain and Aviral Bhardwaj and Kaushik Murali and Isha Surani},
journal= {arXiv preprint arXiv:2406.00237},
year = {2024}
}
备注
8 pages, 6 figures