用于手术室手术活动识别的多视角视频-姿态预训练
计算机视觉与模式识别
2025-02-20 v1
摘要
理解复杂手术室中手术流程的工作流程需要深入理解临床医生及其环境之间的交互。手术活动识别(SAR)是一项关键的计算机视觉任务,用于从多视角摄像头录像中检测活动或阶段。现有的 SAR 模型通常未能考虑细粒度的临床医生动作和多视角知识,或者它们需要校准的多视角摄像头设置和高级点云处理才能获得更好的结果。在这项工作中,我们提出了一种新颖的无标定多视角多模态预训练框架,称为用于视频-姿态手术活动识别的多视角预训练 PreViPS,该框架跨摄像头视图对齐 2D 姿态和视觉嵌入。我们的模型遵循 CLIP 风格的双编码器架构:一个编码器处理视觉特征,而另一个编码器编码人体姿态嵌入。为了处理连续的 2D 人体姿态坐标,我们引入了一种标记化离散表示,将连续的 2D 姿态坐标转换为离散姿态嵌入,从而实现双编码器框架内的高效集成。为了弥合这两种模态之间的差距,我们提出了几种预训练目标,利用嵌入空间内的跨模态和模态内几何约束,并结合掩蔽姿态标记预测策略来增强表示学习。大量的实验和消融研究证明了相对于强基线的改进,而在两个不同的手术室数据集上的数据效率实验进一步突出了我们方法的有效性。我们强调了我们的方法在多视角和单视角设置下进行手术活动识别的优势,展示了其在复杂手术环境中的实际适用性。代码将发布于:https://github.com/CAMMA-public/PreViPS。
引用
@article{arxiv.2502.13883,
title = {Multi-view Video-Pose Pretraining for Operating Room Surgical Activity Recognition},
author = {Idris Hamoud and Vinkle Srivastav and Muhammad Abdullah Jamal and Didier Mutter and Omid Mohareri and Nicolas Padoy},
journal= {arXiv preprint arXiv:2502.13883},
year = {2025}
}