中文

通过观看数百个手术视频讲座学习多模态表示

计算机视觉与模式识别 2025-06-18 v5 人工智能

摘要

近年来,手术计算机视觉应用的进展主要由仅视觉模型推动,这些模型并未将其丰富语言语义显式地整合到设计中。此类方法依赖人工标注的手术视频来预测固定的一组对象类别,限制了其对未见手术流程和下游任务的泛化能力。在本工作中,我们提出,开放手术电子学习平台上的手术视频讲座可提供有效的视觉与语言监督信号,用于多模态表示学习,而无需依赖人工标注。我们通过采用多个互补的自动语音识别系统生成文本转录,以解决手术视频讲座中存在的手术特定语言挑战。随后,我们提出一种新方法——SurgVLP(Surgical Vision Language Pre-training,手术视觉语言预训练),用于多模态表示学习。跨多种手术流程和任务的广泛实验表明,SurgVLP学习的多模态表示在手术视频分析中展现出强大的可迁移性与适应性。此外,我们的零样本评估凸显了SurgVLP作为手术工作流分析通用基础模型的潜力,减少了对下游任务大量人工标注的依赖,并促进了少样本学习等适配方法,以构建可扩展且数据高效的各类下游手术应用解决方案。训练代码(https://github.com/CAMMA-public/PeskaVLP)与权重(https://github.com/CAMMA-public/SurgVLP)已公开。

关键词

引用

@article{arxiv.2307.15220,
  title  = {Learning Multi-modal Representations by Watching Hundreds of Surgical Video Lectures},
  author = {Kun Yuan and Vinkle Srivastav and Tong Yu and Joel L. Lavanchy and Jacques Marescaux and Pietro Mascagni and Nassir Navab and Nicolas Padoy},
  journal= {arXiv preprint arXiv:2307.15220},
  year   = {2025}
}

备注

Accepted by Medical Image Analysis (MedIA), 2025