中文

视频胶囊内窥镜中的多类异常分类任务

图像与视频处理 2024-12-04 v3 计算机视觉与模式识别

摘要

在针对 Capsule Vision Challenge 2024 的工作中,我们利用从定制 CNN 到先进 Transformer 架构的多种深度学习模型,应对了视频胶囊内窥镜(VCE)[1] 中的多类异常分类挑战。其目的是正确分类多种胃肠道疾病,这对于提高临床环境下的诊断效率至关重要。我们以一个基线 CNN 模型为起点,并使用 ResNet[2] 改进特征提取以提升性能,随后采用 Vision Transformer (ViT)[3] 以捕获全局依赖关系。我们进一步使用 Multiscale Vision Transformer (MViT)[4] 改进分层特征提取以提升结果,而 Dual Attention Vision Transformer (DaViT) [5] 通过结合空间与通道注意力方法取得了最佳结果。我们在验证集 [6] 上的最佳平衡准确率为 0.8592,平均 AUC 为 0.9932。该方法使我们能够在广泛的标准上提升模型准确率,大幅超越所有其他方法。此外,我们的团队 capsule commandos 以测试集 [7] 上平均 AUC: 0.7314 和平衡准确率: 0.3235 的表现取得了第 7 名。

关键词

引用

@article{arxiv.2410.19973,
  title  = {Multi-Class Abnormality Classification Task in Video Capsule Endoscopy},
  author = {Dev Rishi Verma and Vibhor Saxena and Dhruv Sharma and Arpan Gupta},
  journal= {arXiv preprint arXiv:2410.19973},
  year   = {2024}
}

备注

Submission for Video Capsule Endoscopy Challenge