中文

CapsoNet:用于视频肠球化内镜多类别异常检测的 CNN-Transformer 集成模型

计算机视觉与模式识别 2025-08-07 v3

摘要

我们提出 CapsoNet,一个为 Capsule Vision 2024 挑战赛开发的深度学习框架,旨在对视频肠球化内镜(VCE)帧进行多类别异常分类。CapsoNet 利用卷积神经网络(CNN)和基于 Transformer 的架构的集成,以捕获局部和全局视觉特征。该模型在来自三个公共数据集和一个私有数据集的超过 50,000 张标注帧(涵盖十个异常类别)上进行训练和评估。为解决类别不平衡问题,我们采用焦点损失、加权随机抽样和广泛的数据增强策略。所有模型均完全微调以最大化集成内的性能。CapsoNet 在官方验证集上实现了 86.34% 的平衡准确率和 0.9908 的平均 AUC-ROC,夺得队伍 Seq2Cure 第五名。我们的实现已在 http://github.com/arnavs04/capsule-vision-2024 上提供。

关键词

引用

@article{arxiv.2410.18879,
  title  = {CapsoNet: A CNN-Transformer Ensemble for Multi-Class Abnormality Detection in Video Capsule Endoscopy},
  author = {Arnav Samal and Ranya Batsyas},
  journal= {arXiv preprint arXiv:2410.18879},
  year   = {2025}
}

备注

Code available at http://github.com/arnavs04/capsule-vision-2024