中文

使用CNN-Transformer模型对内镜和胶囊内镜图像进行分类

图像与视频处理 2024-08-21 v1 计算机视觉与模式识别

摘要

胃肠道癌症是癌症相关发病和死亡的主要原因,因此开发新型计算机辅助诊断系统以进行早期检测和增强治疗至关重要。传统方法依赖胃肠病学家的专业知识来识别疾病;然而,这一过程是主观的,即使专家临床医生之间的解读也可能存在差异。考虑到内镜和胶囊内镜图像中胃肠道异常和标志物分类的最新进展,本研究提出了一种结合Transformer和卷积神经网络(CNN)优势的混合模型,以提高分类性能。我们的模型利用DenseNet201作为CNN分支提取局部特征,并集成Swin Transformer分支进行全局特征理解,将两者结合以执行分类任务。对于GastroVision数据集,我们提出的模型表现出优异的性能,精确率、召回率、F1分数、准确率和马修斯相关系数(MCC)分别为0.8320、0.8386、0.8324、0.8386和0.8191,展示了其对类别不平衡的鲁棒性,并超越了其他CNN和Swin Transformer模型。同样,对于大型视频胶囊内镜数据集Kvasir-Capsule,我们的模型优于所有其他模型,总体精确率、召回率、F1分数、准确率和MCC分别为0.7007、0.7239、0.6900、0.7239和0.3871。此外,我们生成了显著性图以解释模型的关注区域,证明了其可靠的决策过程。结果强调了我们的混合CNN-Transformer模型在辅助早期和准确检测胃肠道(GI)异常方面的潜力。

关键词

引用

@article{arxiv.2408.10733,
  title  = {Classification of Endoscopy and Video Capsule Images using CNN-Transformer Model},
  author = {Aliza Subedi and Smriti Regmi and Nisha Regmi and Bhumi Bhusal and Ulas Bagci and Debesh Jha},
  journal= {arXiv preprint arXiv:2408.10733},
  year   = {2024}
}