探索结合 U-Net 掩码自编码器与 EfficientNet-B7 的自监督学习以改进视频胶囊内镜中的胃肠道异常分类
计算机视觉与模式识别
2026-04-02 v2
摘要
视频胶囊内镜(Video Capsule Endoscopy, VCE)因其无创性及捕获小肠高分辨率图像的能力,已成为胃肠道(GI)疾病不可或缺的诊断工具。然而,单次检查产生的海量数据使得人工检查耗时费力,且易受观察者间差异的影响。利用深度学习进行自动分析提供了一种有前景的解决方案,但其有效性常受限于数据不平衡及标注医学数据的高昂成本。在本工作中,我们提出了一种新颖的框架,将通过基于 U-Net 的掩码自编码器进行的自监督学习与使用 EfficientNet-B7 的监督特征提取相结合,用于 VCE 图像的多类异常分类。U-Net 模型首先通过高斯噪声去除和掩码重建以自监督方式进行训练,从而在无需标注的情况下学习鲁棒的视觉表示。随后,将学习到的编码器特征与 EfficientNet-B7 特征融合,以形成用于分类的丰富且具判别性的表示。我们在包含十种异常类别和一种主导正常类别的 Capsule Vision 2024 挑战赛数据集上评估了该方法。实验结果表明,所提出的融合框架实现了 94% 的验证准确率,优于独立架构及基于注意力的融合变体。本研究突出了自监督表示学习与特征融合在解决类别不平衡及提升真实医学影像场景诊断准确率方面的有效性。
引用
@article{arxiv.2410.19899,
title = {Exploring Self-Supervised Learning with U-Net Masked Autoencoders and EfficientNet-B7 for Improved Gastrointestinal Abnormality Classification in Video Capsule Endoscopy},
author = {Vamshi Krishna Kancharla and Pavan Kumar Kaveti and Dasari Naga Raju},
journal= {arXiv preprint arXiv:2410.19899},
year = {2026}
}
备注
Capsule Vision 2024 Challenge