面向胃肠道内窥镜视觉问题的自监督预训练研究
计算机视觉与模式识别
2024-05-29 v2 机器学习
摘要
胃肠道内窥镜(GIE)视觉任务的解决方案通常使用在 ImageNet-1k 上以监督方式预训练的图像编码器作为骨干网络。然而,采用现代自监督预训练算法以及近期包含 10 万张无标注 GIE 图像的数据集(Hyperkvasir-unlabelled)可能会带来性能提升。在本工作中,我们研究了以自监督和监督方式在 ImageNet-1k 和 Hyperkvasir-unlabelled(仅限自监督)上预训练的、采用 ResNet50 和 ViT-B 骨干网络的模型在一系列 GIE 视觉任务上的微调性能。除了在所考察的方案中为每个任务确定最合适的预训练流程和骨干架构外,我们的结果还揭示了三条一般性原则。首先,自监督预训练通常比监督预训练能为 GIE 视觉任务产生更合适的骨干网络。其次,使用 ImageNet-1k 进行自监督预训练通常比使用 Hyperkvasir-unlabelled 更合适,但在结肠镜单目深度估计方面存在显著例外。第三,ViT-B 在息肉分割和结肠镜单目深度估计中更为合适,ResNet50 在息肉检测中更为合适,而两种架构在解剖标志识别和病理发现表征中的表现相似。我们希望这项工作能引起对 GIE 视觉任务预训练复杂性的关注,为开发比常规方法更合适的方案提供参考,并激发对该主题的进一步研究以推动其发展。代码可用:\underline{github.com/ESandML/SSL4GIE}
引用
@article{arxiv.2401.06278,
title = {A Study on Self-Supervised Pretraining for Vision Problems in Gastrointestinal Endoscopy},
author = {Edward Sanderson and Bogdan J. Matuszewski},
journal= {arXiv preprint arXiv:2401.06278},
year = {2024}
}