中文

基于图增强知识蒸馏的双流动作视觉转换器:用于肠胃疾病分类的区域感知注意力与可解释AI

图像与视频处理 2026-04-28 v2 计算机视觉与模式识别

摘要

从内窥镜和组织病理图像中准确分类肠胃疾病仍是医学诊断的重大挑战,主要由于数据容量庞大且类别间视觉差异微妙。本研究提出了基于教师-学生知识蒸馏的混合双流深度学习框架,其中高容量教师模型集成了基于Swin Transformer 的全局上下文推理与基于视觉转换器的局部细粒度特征提取。学生网络实现为紧凑型 Tiny-ViT 结构,继承教师的语义和形态知识通过软标签蒸馈,实现效率与诊断准确性之间的平衡。采用两个仔细筛选的无线掏取内窥镜数据集,涵盖主要肠胃疾病类别,确保平衡表示并防止样本间偏差。该框架在Dataset 1 和 Dataset 2 上分别实现了0.9978和0.9928的准确率,平均AUC达到1.0000,显示出近乎完美的判别能力。使用 Grad-CAM、LIME 和 Score-CAM 进行可解释性分析确认,模型的预测基于临床相关组织区域和病理相关形态线索,验证了该框架的透明性和可靠性。Tiny-ViT 在保持与基于转换器的教师相当的诊断性能的同时,显著降低了计算复杂度,实现更快的推理,适用于资源受限的临床环境。总体而言,所提出的框架为AI辅助肠胃疾病诊断提供了稳健、可解释且可扩展的解决方案,为未来兼容临床实用性的智能内窥镜筛查铺平了道路。

关键词

引用

@article{arxiv.2512.21372,
  title  = {A Graph-Augmented knowledge Distillation based Dual-Stream Vision Transformer with Region-Aware Attention for Gastrointestinal Disease Classification with Explainable AI},
  author = {Md Assaduzzaman and Nushrat Jahan Oyshi and Eram Mahamud},
  journal= {arXiv preprint arXiv:2512.21372},
  year   = {2026}
}