中文

面向手术基础模型的视频预训练扩展

计算机视觉与模式识别 2026-04-03 v2

摘要

手术视频理解对于计算机辅助干预至关重要,然而现有的手术基础模型仍受限于有限的数据规模、程序多样性和不一致的评估,往往缺乏可复现的训练流程。我们提出了 SurgRec,一个用于手术视频理解的可扩展且可复现的预训练方案,包含两个变体:SurgRec-MAE 和 SurgRec-JEPA。我们整理了一个来自多来源的大型语料库,包含 10,535 个视频和 2.145 亿帧,涵盖内窥镜、腹腔镜、白内障和机器人手术。基于该语料库,我们开发了一个统一的预训练流程并实现了平衡采样,并在 16 个下游数据集和四个临床领域上标准化了可复现的基准,使用一致的数据划分。在与 SSL 基线和视觉语言模型的广泛比较中,SurgRec 在所有下游数据集上持续取得了优越的性能。相比之下,视觉语言模型在细粒度时间识别方面不可靠,表现出性能差距和对提示措辞的敏感性。本工作为社区构建更通用的手术视频模型提供了一个可复现、可扩展的基础。所有代码、模型和数据将公开发布。

关键词

引用

@article{arxiv.2603.29966,
  title  = {Scaling Video Pretraining for Surgical Foundation Models},
  author = {Sicheng Lu and Zikai Xiao and Jianhui Wei and Danyu Sun and Qi Lu and Keli Hu and Yang Feng and Jian Wu and Zongxin Yang and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2603.29966},
  year   = {2026}
}