中文

SurgLaVi:用于外科视觉-语言表征学习的大规模层次化数据集

计算机视觉与模式识别 2026-02-06 v2

摘要

视觉-语言预训练(VLP)通过将语言与外科视频对齐,为外科手术提供了独特优势,能够在不依赖专家标注数据集的情况下实现工作流理解和跨任务迁移。然而,外科 VLP 的进展仍受到现有数据集在规模、流程多样性、语义质量和层次结构方面的限制。在本工作中,我们提出了 SurgLaVi,这是迄今为止最大、最多样化的外科视觉-语言数据集,包含来自 200 多个手术程序的近 24 万个片段-字幕对,并具有粗粒度、中粒度和细粒度的层次结构。SurgLaVi 的核心是一个全自动流水线,系统地生成外科视频的细粒度转录,并将其分割为连贯的程序单元。为确保高质量的标注,该流水线应用双模态过滤来移除无关和有噪声的样本。在此框架内,生成的字幕富含上下文细节,产生的标注既具有丰富的语义又易于解释。为保证可及性,我们发布了 SurgLaVi-\beta\b{eta},这是一个完全由公开数据构建的、包含 11.3 万个片段-字幕对的开源衍生数据集,比现有的外科 VLP 数据集大四倍多。为展示 SurgLaVi 数据集的价值,我们引入了 SurgCLIP,一个具有双编码器的 CLIP 风格视频-文本对比框架,作为代表性的基础模型。SurgCLIP 在阶段、步骤、动作和工具识别方面均取得了一致的提升,超越了先前最先进的方法,且通常优势显著。这些结果验证了大规模、语义丰富且具有层次结构的数据集可以直接转化为更强、更具泛化能力的表征,将 SurgLaVi 确立为开发外科基础模型的关键资源。

关键词

引用

@article{arxiv.2509.10555,
  title  = {SurgLaVi: Large-Scale Hierarchical Dataset for Surgical Vision-Language Representation Learning},
  author = {Alejandra Perez and Chinedu Nwoye and Ramtin Raji Kermani and Omid Mohareri and Muhammad Abdullah Jamal},
  journal= {arXiv preprint arXiv:2509.10555},
  year   = {2026}
}