中文

脑、肺和肾肿瘤多模态图像分类中视觉Transformer模型的评估:案例研究

计算机视觉与模式识别 2025-06-17 v2

摘要

神经网络已成为癌症检测和分类医学诊断的标准技术。本文评估了包括Swin Transformer和MaxViT在内的视觉Transformer架构在磁共振成像(MRI)和CT扫描several数据集中的性能。我们使用了包含脑肿瘤、肺肿瘤和肾脏肿瘤的三个训练图像数据集。每个数据集包括不同的分类标签,从脑腺瘤和脑膜瘤到良恶性肺部疾病以及肾脏异常如囊肿和癌症。本文旨在分析神经网络在每个数据集中的表现以及结合不同图像模态和肿瘤类别的优势。我们设计了多个实验,通过在组合和单个数据集上进行微调。结果显示,Swin Transformer实现了高准确率,在单个数据集上平均达到99%准确率,在组合数据集上达到99.4%准确率。这项研究突显了基于Transformer的模型对各种图像模态和特征的适应性。然而,挑战仍然存在,包括标注数据有限和可解释性问题。未来工作将通过纳入其他图像模态并增强诊断能力来扩展本研究。将这些模型跨越不同数据集集成,可能为精密医学的发展铺平了重要道路,为更高效和全面的医疗解决方案 paving the way。

关键词

引用

@article{arxiv.2502.05517,
  title  = {Evaluation of Vision Transformers for Multimodal Image Classification: A Case Study on Brain, Lung, and Kidney Tumors},
  author = {Óscar A. Martín and Javier Sánchez},
  journal= {arXiv preprint arXiv:2502.05517},
  year   = {2025}
}

备注

19 pages, 9 figures, 12 tables