中文

VidLPRO:面向机器人手术与腔内手术的视频-语言预训练框架

计算机视觉与模式识别 2024-09-13 v2 人工智能

摘要

我们介绍 VidLPRO,一个专为机器人手术和腔内手术设计的新型视频-语言(VL)预训练框架。虽然现有手术 VL 模型主要依赖对比学习,但我们提出了更全面的方法来捕捉复杂的时间动态并实现视频与语言的对齐。VidLPRO 集成了视频-文本对比学习、视频-文本匹配和掩码语言模型目标,以学习丰富的 VL 表示。为支持该框架,我们提出 GenSurg+,一个来自 GenSurgery 的精心挑选的数据集,包含 17k 条手术视频剪辑,配有由 Whisper 模型提取的转录文本生成的 GPT-4 描述 captions。该数据集解决了手术领域大规模高质量 VL 数据的需求。在 Cholec80 和 AutoLaparo 等基准数据集上的大量实验表明,我们的方法有效。VidLPRO 在零样本手术阶段识别中实现了最前沿的性能,显著优于 SurgVLP 和 HecVL 等现有手术 VL 模型。我们的模型在准确率提升最高可达 21.5%,F1 分数提升 15.7%,为该领域树立了新的基准。值得注意的是,VidLPRO 即使在单帧推理时也表现出鲁健性,而在增加时间上下文后仍能有效扩展。消融研究揭示了帧采样策略对模型性能和计算效率的影响。这些结果凸显了 VidLPRO 作为手术视频理解基础模型的潜力。

关键词

引用

@article{arxiv.2409.04732,
  title  = {VidLPRO: A $\underline{Vid}$eo-$\underline{L}$anguage $\underline{P}$re-training Framework for $\underline{Ro}$botic and Laparoscopic Surgery},
  author = {Mohammadmahdi Honarmand and Muhammad Abdullah Jamal and Omid Mohareri},
  journal= {arXiv preprint arXiv:2409.04732},
  year   = {2024}
}