面向智能外科手术的大规模自监督视频基础模型
计算机视觉与模式识别
2025-06-04 v1
摘要
计算机辅助介入(CAI)有望彻底改变现代外科手术,其中手术场景理解是支持决策制定、提高手术效率和确保术中安全的关键组成部分。虽然现有的 AI 驱动方法通过自监督空间表示学习减轻了标注负担,但它们在预训练期间缺乏显式的时间建模,从根本上限制了对动态手术上下文的捕捉,导致时空理解不完整。在这项工作中,我们引入了第一个视频级手术预训练框架,能够从大规模手术视频数据中学习联合时空表示。为了实现这一点,我们构建了一个包含 3,650 个视频和约 355 万帧的大规模手术视频数据集,涵盖 20 多种手术程序和 10 多种解剖结构。在此数据集的基础上,我们提出了 SurgVISTA(Surgical Video-level Spatial-Temporal Architecture,手术视频级时空架构),这是一种基于重建的预训练方法,通过联合时空建模捕捉复杂的空间结构和时间动态。此外,SurgVISTA 结合了由手术特定专家指导的图像级知识蒸馏,以增强对细粒度解剖和语义特征的学习。为了验证其有效性,我们建立了一个综合基准,包含跨越四项任务和六种手术程序的 13 个视频级数据集。大量实验表明,SurgVISTA 始终优于自然域和手术域的预训练模型,展现出在临床有意义场景中推进智能手术系统的巨大潜力。
引用
@article{arxiv.2506.02692,
title = {Large-scale Self-supervised Video Foundation Model for Intelligent Surgery},
author = {Shu Yang and Fengtao Zhou and Leon Mayer and Fuxiang Huang and Yiliang Chen and Yihui Wang and Sunan He and Yuxiang Nie and Xi Wang and Ömer Sümer and Yueming Jin and Huihui Sun and Shuchang Xu and Alex Qinyang Liu and Zheng Li and Jing Qin and Jeremy YuenChun Teoh and Lena Maier-Hein and Hao Chen},
journal= {arXiv preprint arXiv:2506.02692},
year = {2025}
}