中文

面向胃肠道内窥镜医学图像分类的自监督基础模型的领域自适应预训练

计算机视觉与模式识别 2024-12-12 v4 机器学习

摘要

视频胶囊内窥镜通过提供一种非侵入性方法来捕获胃肠道的详细图像,实现了早期疾病检测,从而变革了胃肠道内窥镜(GIE)诊断。然而,其潜力受到成像过程中产生的大量图像的限制,该过程通常需要6-8小时,并可能产生多达100万张图像,因此需要自动化分析。此外,这些图像的变异性,加上对专家标注的需求以及大型高质量标注数据集的稀缺,限制了当前医学图像分析模型的有效性。为解决此问题,我们引入了一个新颖的大型GIE数据集,称为EndoExtend24,该数据集通过合并十个现有的公开和私有数据集创建,确保了不同数据划分中患者数据的完整性。EndoExtend24包含超过226,000张标注图像,以及动态类别映射,允许在具有不同标注粒度的数据集上进行统一训练,支持多达123种不同的病理发现。此外,我们提出利用在通用图像数据上通过自监督训练的基础模型进行领域自适应预训练,使其适应GIE医学图像诊断任务。具体来说,基于ViT架构并在ImageNet-22k上使用掩码图像建模(以EVA-CLIP作为MIM教师)训练的EVA-02模型,在EndoExtend24数据集上进行预训练以实现领域自适应,最后在Capsule Endoscopy 2024 Challenge数据集上进行训练。我们的模型展现出稳健的性能,在Capsule Endoscopy 2024 Challenge中获得第三名。我们在测试集上实现了0.762的宏AUC和37.1%的平衡准确率。这些结果强调了我们的领域自适应预训练方法和丰富的EndoExtend24数据集在推进胃肠道内窥镜诊断方面的有效性。

关键词

引用

@article{arxiv.2410.21302,
  title  = {Domain-Adaptive Pre-training of Self-Supervised Foundation Models for Medical Image Classification in Gastrointestinal Endoscopy},
  author = {Marcel Roth and Micha V. Nowak and Adrian Krenzer and Frank Puppe},
  journal= {arXiv preprint arXiv:2410.21302},
  year   = {2024}
}