中文

面向零样本外科阶段识别的层次化视频语言预训练方法 HecVL

计算机视觉与模式识别 2025-03-14 v2 人工智能

摘要

自然语言在开发通用外科模型方面发挥重要作用,通过从原始文本中提供广泛的监督信息。这种灵活的监督形式可以使模型在不同数据集和任务之间具有更好的可迁移性,因为自然语言可以用于引用已学习的视觉概念或描述新的概念。在本工作中,我们提出了 HecVL,这是一种用于构建通用外科模型的层次化视频语言预训练方法。具体而言,我们构建了一个层次化视频文本配对数据集,通过将外科讲座视频与三个层次级的文本进行配对:在片段级别,使用转录的音频文本中的原子动作;在阶段级别,概念性文本摘要;在视频级别,整个外科程序的概括性文本。然后,我们提出了一种新颖的细到粗的对比学习框架,使用单个模型学习三个视频文本层次结构的独立嵌入空间。通过分离不同层次级嵌入空间,所学的多模态表示在同一模型中编码了短期和长期外科概念。由于注入了文本语义,我们展示 HecVL 方法可以实现无需任何人工标注的零样本外科阶段识别。此外,我们表明相同的 HecVL 模型可用于外科阶段识别的不同外科程序和医疗中心之间的迁移。代码可在 https://github.com/CAMMA-public/SurgVLP 获取。

关键词

引用

@article{arxiv.2405.10075,
  title  = {HecVL: Hierarchical Video-Language Pretraining for Zero-shot Surgical Phase Recognition},
  author = {Kun Yuan and Vinkle Srivastav and Nassir Navab and Nicolas Padoy},
  journal= {arXiv preprint arXiv:2405.10075},
  year   = {2025}
}

备注

Accepted by MICCAI2024