面向手术程序的层次化知识增强视频语言预训练方法
计算机视觉与模式识别
2025-03-14 v2 人工智能
摘要
手术视频语言预训练(VLP)因知识领域差距和多模态数据的稀缺性面临独特挑战。本研究旨在通过解决手术讲座视频中文本信息丢失问题及手术VLP的时空挑战,来弥合这一差距。我们提出了一种层次化知识增强方法,以及一种新颖的程序编码手术知识增强视频语言预训练框架(PeskaVLP),以应对这些问题。该知识增强利用大型语言模型(LLM)对手术概念进行细化和丰富,从而提供全面的语言监督,减少过拟合风险。PeskaVLP将语言监督与视觉自监督相结合,构建硬负样本,并采用基于动态时间变形(DTW)的损失函数,有效地理解跨模态程序对齐。在多个公开的手术场景理解和跨模态检索数据集上的大量实验表明,我们的方法显著提高了零样本迁移性能,为手术场景理解的进一步发展提供了通用视觉表征。代码已公开于 https://github.com/CAMMA-public/SurgVLP
引用
@article{arxiv.2410.00263,
title = {Procedure-Aware Surgical Video-language Pretraining with Hierarchical Knowledge Augmentation},
author = {Kun Yuan and Vinkle Srivastav and Nassir Navab and Nicolas Padoy},
journal= {arXiv preprint arXiv:2410.00263},
year = {2025}
}
备注
Accepted at the 38th Conference on Neural Information Processing Systems (NeurIPS 2024 Spolight)