中文

外科视觉理解(SurgVU)数据集

计算机视觉与模式识别 2026-05-11 v2

摘要

鉴于机器学习的 recent 进步以及在机器人辅助手术期间大规模数据采集的能力, 手术数据科学正处于需要基础性工作的阶段. 我们提出了一个大型手术视频及其伴随标签的数据集以供此用. 我们描述了数据的收集方式及其独特属性. 列举了若干示例问题. 虽然该数据集是为特定的一组科学挑战策划的(见另一篇论文), 但其足够通用以用于广泛的机器学习问题. 我们希望该数据集能使更广泛的机器学习社区暴露于手术数据科学中面临的挑战性问题之中, 并成为未来研究的标杆. 视频可在 https://storage.googleapis.com/isi-surgvu/surgvu24_videos_only.zip 访问, 标签可在 https://storage.googleapis.com/isi-surgvu/surgvu24_labels_updated_v2.zip 访问, 用于工具检测问题的验证集可在 https://storage.googleapis.com/isi-surgvu/cat1_test_set_public.zip 访问, 用于手术视觉问答的示例问答对集合可在 https://storage.googleapis.com/isi-surgvu/SURGVU25_cat_2_sample_set_public.zip 访问.

关键词

引用

@article{arxiv.2501.09209,
  title  = {Surgical Visual Understanding (SurgVU) Dataset},
  author = {Aneeq Zia and Max Berniker and Rogerio Nespolo and Xiaorui Zhang and Conor Perreault and Ziheng Wang and Benjamin Mueller and Ryan Schmidt and Kiran Bhattacharyya and Xi Liu and Anthony Jarc},
  journal= {arXiv preprint arXiv:2501.09209},
  year   = {2026}
}