中文

内窥镜领域预训练是否有意义以及何时才有意义?

计算机视觉与模式识别 2023-04-03 v1

摘要

自动化内窥镜视频分析是医学计算机视觉中的一项挑战性任务,其主要目标是为手术过程中的外科医生提供辅助。其困难源于手术场景的复杂性以及缺乏足够数量的标注数据。近年来,大规模预训练在自然语言处理和计算机视觉领域取得了巨大成功。这些方法降低了对标注数据的需求,而这一直是医学领域的一个关切点。然而,大多数关于内窥镜视频理解的工作使用在自然图像上预训练的模型,从而在预训练与微调之间产生了领域鸿沟。在本工作中,我们基于下游目标研究了内窥镜领域特定预训练的需求。为此,我们首先收集了 Endo700k——从九个公开微创外科(MIS)数据集中提取的最大公开可用内窥镜图像语料库。Endo700k 包含超过 700,000 张未标注的原始图像。接下来,我们引入了 EndoViT,一种内窥镜预训练的 Vision Transformer (ViT)。通过消融实验,我们表明领域特定预训练对于更复杂的下游任务(如动作三元组检测)尤其有益,而对于较简单的任务(如手术阶段识别)则效果较差甚至不必要。我们将在论文被接收后发布我们的代码和预训练模型,以促进该方向的进一步研究。

关键词

引用

@article{arxiv.2303.17636,
  title  = {Whether and When does Endoscopy Domain Pretraining Make Sense?},
  author = {Dominik Batić and Felix Holm and Ege Özsoy and Tobias Czempiel and Nassir Navab},
  journal= {arXiv preprint arXiv:2303.17636},
  year   = {2023}
}