中文

面向自监督学习的共焦激光内镜镜象视频序列过滤方案

计算机视觉与模式识别 2025-11-17 v2 人工智能 机器学习

摘要

共焦激光内镜成像(CLE)是一种非侵入性的实时成像手段,可用于现场、体内成像和黏膜结构的微观分析。然而,CLE诊断因图像难以被非经验丰富的医生解读而复杂。利用机器学习作为辅助工具因此具有意义,但受限于与CLEM图像序列在标注、模式多样性方面的不足,导致机器学习模型易过拟合。为此,可在更大规模的无标签数据集上采用自监督学习(SSL)来克服此限制。CLE为视频式模态,具有高度帧间相关性,导致SSL训练的数据分布非层次化。本文提出一种针对CLE视频序列的过滤方案,以减少SSL训练中的数据冗余,提高SSL训练的收敛性和训练效率。我们使用四种最先进的基线网络和一个基于视觉Transformer小型骨干网络的SSL教师学生网络进行评估。这些网络在下游任务上分别在鼻咽部肿瘤数据集和皮肤鳞状细胞癌数据集上进行评估。在两个数据集上,我们发现经过滤除的SSL预训练模型在测试准确率上最高,分别达到67.48%和73.52%,均显著优于非SSL基线。我们的结果表明,SSL是CLE预训练的有效方法。进一步,我们展示所提出的CLE视频过滤器可用于提高自监督场景下的训练效率,实现训练时间缩短67%。

关键词

引用

@article{arxiv.2511.00098,
  title  = {A filtering scheme for confocal laser endomicroscopy (CLE)-video sequences for self-supervised learning},
  author = {Nils Porsche and Flurin Müller-Diesing and Sweta Banerjee and Miguel Goncalves and Marc Aubreville},
  journal= {arXiv preprint arXiv:2511.00098},
  year   = {2025}
}