通过蒸馏自监督实现手术视频理解的免费午餐
计算机视觉与模式识别
2022-09-27 v2
摘要
自监督学习在计算机视觉和自然语言处理领域取得了巨大进展;近来,它也引起了人们对 X 射线、CT 和 MRI 等多种医学成像模态的广泛关注。现有方法大多根据医学图像的特性,侧重于构建重建、朝向和掩码识别等新的代理自监督任务。然而,公开可用的自监督模型并未被充分利用。本文提出了一种强大且高效的手术视频理解自监督框架。我们的核心见解是:从在大型通用数据集上训练的公开可用模型中蒸馏知识,以促进手术视频的自监督学习。为此,我们首先引入一种语义保持训练方案来获得教师模型,该模型不仅包含来自公开可用模型的语义,还能为手术数据生成准确的知识。除仅使用对比学习进行训练外,我们还引入了蒸馏目标,将教师模型中丰富的已学信息迁移到手术数据的自监督学习中。在两个手术阶段识别基准上的大量实验表明,我们的框架能显著提升现有自监督学习方法的性能。值得注意的是,我们的框架在低数据场景下展现出显著优势。我们的代码见 https://github.com/xmed-lab/DistillingSelf。
引用
@article{arxiv.2205.09292,
title = {Free Lunch for Surgical Video Understanding by Distilling Self-Supervisions},
author = {Xinpeng Ding and Ziwei Liu and Xiaomeng Li},
journal= {arXiv preprint arXiv:2205.09292},
year = {2022}
}
备注
accepted at MICCAI 2022