中文

观察与学习:利用专家知识与语言进行手术视频理解

计算机视觉与模式识别 2025-03-17 v1

摘要

自动化手术工作流分析对于教育、研究和临床决策至关重要,但标注数据集的缺乏阻碍了准确且全面的工作流分析解决方案的开发。受人类通过观察专家并理解其解释的学习过程启发,我们引入了一种新颖的方法,以解决标注训练数据的稀疏性与异构性问题。我们的方法利用在对齐、去噪和生成任务上训练的视频语言模型来学习短期时空与多模态表征。随后使用特定任务的时序模型来捕捉整个视频中的关系。为了在手术领域实现全面的视频语言理解,我们引入了一种数据收集与过滤策略,从教育性 YouTube 视频中构建大规模预训练数据集。然后,我们通过将公开可用手术数据集中的下游任务标注投射到语言域,利用参数高效微调。在两个手术领域的广泛实验证明了我们方法的有效性,在阶段分割任务中性能提升达 7%,在零样本阶段分割中提升达 8%,并且在少样本设置中具备与全监督模型相当的能力。利用我们模型在长程时序定位与文本生成方面的能力,我们提出了首个针对手术视频的密集视频描述(DVC)综合解决方案,在手术领域缺乏现有 DVC 数据集的情况下解决了该任务。我们引入了一种新颖的手术工作流理解方法,该方法利用视频语言预训练、大规模视频预训练和优化的微调。我们的方法改进了相对于 SOTA 技术的性能,并为手术视频理解启用了新的下游任务。

关键词

引用

@article{arxiv.2503.11392,
  title  = {Watch and Learn: Leveraging Expert Knowledge and Language for Surgical Video Understanding},
  author = {David Gastager and Ghazal Ghazaei and Constantin Patsch},
  journal= {arXiv preprint arXiv:2503.11392},
  year   = {2025}
}

备注

14 pages main manuscript with 3 figures; 6 pages supplementary material with 3 figures. To be presented at International Conference on Information Processing in Computer-Assisted Interventions (IPCAI 2025). To be published in International Journal of Computer Assisted Radiology and Surgery (IJCARS)