中文

SurgMotion:面向手术视频的通用视频原生基础模型

计算机视觉与模式识别 2026-04-20 v3

摘要

尽管基础模型已推动手术视频分析,但当前方法主要依赖像素级重建目标,将模型容量浪费在低层视觉细节上,如烟雾、光斑反射和流体运动,而非对手术理解至关重要的语义结构。我们提出的 SurgMotion 是一种视频原生基础模型,转变学习范式从像素级重建到潜在运动预测。基于 Video Joint Embedding Predictive Architecture (V-JEPA) 构建的 SurgMotion 引入了三个针对手术视频的关键技术创新:(1) 运动引导的潜在掩码预测,以优先处理语义上有意义的区域;(2) 时空关联自蒸馏,以强制关系一致性;(3) 时空特征多样性正则化 (SFDR),防止纹理稀疏手术场景中的特征坍缩。为实现大规模预训练,我们策划了 SurgMotion-15M,即迄今为止最大的手术视频数据集,包含 3658 小时的视频,来自 50 个数据源,覆盖 13 个解剖区域。广泛的实验在 17 个基准测试上表明,SurgMotion 在手术工作流程识别方面显著优于最先进的方法,在 EgoSurgery 上 F1 分数提升 14.6 百分点,在 PitVis 上提升 10.3 百分点;在动作三元组识别中,CholecT50 上实现 39.54% mAP-IVT;以及在技能评估、结肠息肉分割和深度估计方面。这些结果将 SurgMotion 确立为通用、面向运动的手术视频理解新标准。

关键词

引用

@article{arxiv.2602.05638,
  title  = {SurgMotion: A Video-Native Foundation Model for Universal Understanding of Surgical Videos},
  author = {Jinlin Wu and Felix Holm and Chuxi Chen and An Wang and Yaxin Hu and Xiaofan Ye and Zelin Zang and Miao Xu and Lihua Zhou and Huai Liao and Danny T. M. Chan and Ming Feng and Wai S. Poon and Hongliang Ren and Dong Yi and Nassir Navab and Gaofeng Meng and Jiebo Luo and Hongbin Liu and Zhen Lei},
  journal= {arXiv preprint arXiv:2602.05638},
  year   = {2026}
}