中文

基于大规模自监督预训练的内镜视频分析基础模型

计算机视觉与模式识别 2024-01-10 v4

摘要

基础模型已在疾病诊断和文本报告生成等多种应用中展现出显著成功。迄今为止,用于内镜视频分析的基础模型仍然缺失。在本文中,我们提出Endo-FM,一种利用海量内镜视频数据专门开发的基模型。首先,我们构建了一个视频Transformer,可捕获空间与时间维度上局部和全局的长程依赖。其次,我们通过自监督方式使用全局与局部视图预训练该Transformer模型,旨在使其对时空变化具有鲁棒性并在不同场景间具判别力。为开发该基础模型,我们通过整合9个公开可用数据集和中国上海仁济医院宝山分院的私有采集数据集,构建了一个大规模内镜视频数据集。我们的数据集总体包含超过33K个视频片段、多达500万帧,涵盖多种协议、目标器官和疾病类型。我们预训练的Endo-FM可作为骨干网络,通过微调轻松用于给定下游任务。通过在分类、分割和检测3类不同下游任务上的实验,我们的Endo-FM大幅超越当前最先进(SOTA)的自监督预训练与基于适配器的迁移学习方法,如VCL(分类、分割和检测的F1分别提升3.1%、Dice提升4.8%、F1提升5.5%)和ST-Adapter(分类、分割和检测的F1分别提升5.9%、Dice提升9.6%、F1提升9.9%)。代码、数据集和模型发布于 https://github.com/med-air/Endo-FM。

关键词

引用

@article{arxiv.2306.16741,
  title  = {Foundation Model for Endoscopy Video Analysis via Large-scale Self-supervised Pre-train},
  author = {Zhao Wang and Chang Liu and Shaoting Zhang and Qi Dou},
  journal= {arXiv preprint arXiv:2306.16741},
  year   = {2024}
}

备注

MICCAI 2023 camera-ready version