中文

基于焦点调制引导卷积神经网络的视频胶囊内镜分类

图像与视频处理 2022-06-17 v1 计算机视觉与模式识别

摘要

视频胶囊内镜是计算机视觉与医学中的研究热点。深度学习可对视频胶囊内镜技术的未来产生积极影响,它能提高异常检测率、减少医师筛查时间,并辅助真实世界临床分析。用于视频胶囊内镜的CADx分类系统已展现出进一步优化的巨大潜力,例如对癌性息肉与出血的检测可促成快速医疗响应并提高患者生存率。为此,自动化CADx系统必须具备高吞吐量与良好精度。本文提出FocalConvNet,一种集成了轻量卷积层的焦点调制网络,用于小肠解剖标志与管腔发现的分类。FocalConvNet利用焦点调制获取全局上下文,并允许在整个前向传播过程中进行全局-局部空间交互。此外,卷积块凭借其固有的归纳/学习偏置及提取层次特征的能力,使我们的FocalConvNet以高吞吐量取得良好结果。我们在Kvasir-Capsule(一个含44,228帧、涵盖13类不同异常的大规模VCE数据集)上将FocalConvNet与其他SOTA方法比较。所提方法的加权F1分数、召回率与MCC分别为0.6734、0.6373和0.2974,优于其他SOTA方法。此外,我们报告了148.02幅/秒的最高吞吐量,确立了FocalConvNet在实时临床环境中的潜力。所提FocalConvNet的代码见https://github.com/NoviceMAn-prog/FocalConvNet。

关键词

引用

@article{arxiv.2206.08298,
  title  = {Video Capsule Endoscopy Classification using Focal Modulation Guided Convolutional Neural Network},
  author = {Abhishek Srivastava and Nikhil Kumar Tomar and Ulas Bagci and Debesh Jha},
  journal= {arXiv preprint arXiv:2206.08298},
  year   = {2022}
}