中文

用于手术手势识别的零样本提示视频编码器

计算机视觉与模式识别 2024-08-23 v2

摘要

目的:为了构建能够支持多种手术流程的手术手势识别系统,要么必须获取非常大的标注数据集,要么拟合的模型必须能够泛化到新标签(即所谓的“零样本”能力)。在本文中,我们研究了后一种选择的可行性。方法:利用 Bridge-Prompt 框架,我们对预训练的视觉-文本模型(CLIP)进行提示微调,以用于手术视频中的手势识别。这可以利用外部视频数据(如文本),同时也能利用标签元数据和弱监督对比损失。结果:我们的实验表明,基于提示的视频编码器在手术手势识别任务中优于标准编码器。值得注意的是,它在零样本场景中表现出色,其中在编码器训练阶段未提供的手势/任务被包含在预测阶段。此外,我们测量了在特征提取器训练模式中包含文本描述的益处。结论:Bridge-Prompt 及类似的预训练+提示微调视频编码器模型为手术机器人提供了重要的视觉表示,尤其是在手势识别任务中。鉴于手术任务(手势)的多样性,这些模型无需任何任务(手势)特定的重训练即可进行零样本迁移的能力使其极具价值。

关键词

引用

@article{arxiv.2403.19786,
  title  = {Zero-shot Prompt-based Video Encoder for Surgical Gesture Recognition},
  author = {Mingxing Rao and Yinhong Qin and Soheil Kolouri and Jie Ying Wu and Daniel Moyer},
  journal= {arXiv preprint arXiv:2403.19786},
  year   = {2024}
}

备注

17 pages,4 figures, 7 tables, IPCAI 2024 & IJCARS