中文

GastroViT:基于视觉转换器的集成学习方法用于胃肠疾病分类,附Grad-CAM与SHAP可视化

图像与视频处理 2025-10-01 v1 计算机视觉与模式识别

摘要

人类胃肠道可出现多种各异的黏膜异常发现, ranging from 轻微刺激到极其致命的疾病。及时识别胃肠疾病有助于阻止疾病进程的进行并改善治疗效果。本文提出了一种用于精确分类胃肠道内镜图像以分类胃肠问题和疾病的预训练视觉转换器(ViT)集成体。ViT是一种基于注意力的神经网络,已通过利用转换器架构的变革性力量,在 various visual tasks 中实现了最新技术(SOTA)性能。该模型在包含23种不同胃肠疾病的公开数据集HyperKvasir(共10,662张图像)上进行评估,以识别胃肠道疾病。提出的集成方法利用两个预训练模型MobileViT_XS和MobileViT_V2_200的预测结果,分别实现了90.57%和90.48%的准确率。所有单个模型都被集成模型GastroViT超越,其在包含23个类别的首次测试中,平均精确率、召回率、F1得分和准确率分别为69%、63%、64%和91.98%。该模型仅包含2000万个参数,即使在无数据增强且数据集高度不平衡的情况下也能实现良好性能。在第二次包含16个类别的测试中,得分更高,平均精确率、召回率、F1得分和准确率分别为87%、86%、87%和92.70%。此外,集成Grad-CAM(梯度加权类激活图)和SHAP(Shapley可加解释)等可解释人工智能(XAI)方法,增强了模型的可解释性,为实际场景中可靠的胃肠诊断提供了宝贵的见解。

关键词

引用

@article{arxiv.2509.26502,
  title  = {GastroViT: A Vision Transformer Based Ensemble Learning Approach for Gastrointestinal Disease Classification with Grad CAM & SHAP Visualization},
  author = {Sumaiya Tabassum and Md. Faysal Ahamed and Hafsa Binte Kibria and Md. Nahiduzzaman and Julfikar Haider and Muhammad E. H. Chowdhury and Mohammad Tariqul Islam},
  journal= {arXiv preprint arXiv:2509.26502},
  year   = {2025}
}