SurgBench:面向手术视频分析的统一大规模基准
计算机视觉与模式识别
2025-06-17 v2 人工智能
摘要
手术视频理解是实现内 operative 决策自动化、技能评估和术后质量改进的关键因素。然而,由于缺乏大规模、多样化的数据集用于预训练和系统评估,发展手术视频基础模型(Foundation Models, FMs)的进展受到限制。本文介绍 \textbf{SurgBench},一个统一的手术视频基准框架,包括预训练数据集 \textbf{SurgBench-P} 和评估基准 \textbf{SurgBench-E}。SurgBench 提供了广泛的手术场景覆盖,SurgBench-P 包含 5300 万帧,覆盖 22 种手术程序和 11 个科室;SurgBench-E 提供了跨六大类的(相位分类、摄像运动、工具识别、疾病诊断、动作分类和器官检测)72 个细粒度任务的稳健评估。大量实验表明,现有视频 FMs 在面对各种手术视频分析任务时难以获得良好泛化能力,而在 SurgBench-P 上预训练可显著提升性能,并在 unseen 程序和模态上实现 superior 跨域泛化。我们的数据集和代码将在请求后提供。
引用
@article{arxiv.2506.07603,
title = {SurgBench: A Unified Large-Scale Benchmark for Surgical Video Analysis},
author = {Jianhui Wei and Zikai Xiao and Danyu Sun and Luqi Gong and Zongxin Yang and Zuozhu Liu and Jian Wu},
journal= {arXiv preprint arXiv:2506.07603},
year = {2025}
}