CliPPER:面向手术程序事件识别的长时段内镜手术视频语言预训练框架
计算机视觉与模式识别
2026-03-26 v1 人工智能
摘要
视频语言基础模型在广泛的任务中展现出高度有效的零样本应用能力。一个 particularly 有挑战性的领域是内镜手术程序领域,此处标注数据稀缺,且对复杂下游任务需要精确的时间理解。为此,我们引入 CliPPER(Contextual Video-Language Pretraining on Long-form Intraoperative Surgical Procedures for Event Recognition),一个在手术讲座视频上训练的新型视频语言预训练框架。我们的方法旨在实现细粒度的时间视频文本识别,并引入若干新颖的预训练策略以提高长时段手术视频中多模态对齐效果。具体而言,我们提出了情境视频文本对比学习 (Contextual Video-Text Contrastive Learning, VTC_CTX) 和剪辑顺序预测 (Clip Order Prediction, COP) 两种预训练目标,两者均利用时间和情境依赖性以增强局部视频理解。此外,我们在同一手术视频内部的视频文本匹配中引入循环一致性对齐,以实现双向一致性并提高整体表示一致性。我们还引入了更精细的对齐损失——帧文本匹配 (Frame-Text Matching, FTM),以提高视频帧与文本之间的对齐。结果表明,我们的模型在多个公开手术基准测试上建立了新的状态-of-the-art,包括阶段、步骤、器械及三元组的零样本识别。源代码和预训练标题可在 https://github.com/CAMMA-public/CliPPER 查找。
引用
@article{arxiv.2603.24539,
title = {CliPPER: Contextual Video-Language Pretraining on Long-form Intraoperative Surgical Procedures for Event Recognition},
author = {Florian Stilz and Vinkle Srivastav and Nassir Navab and Nicolas Padoy},
journal= {arXiv preprint arXiv:2603.24539},
year = {2026}
}