中文

SurgPub-Video:面向视觉语言模型的综合性手术视频数据集

其他定量生物学 2026-01-21 v1

摘要

视觉语言模型(VLMs)在手术场景分析方面显示出巨大的潜力,但现有模型受限于帧级数据集,缺乏具备程序性手术知识的高质量视频数据。为此,我们作出以下贡献:(i) SurgPub-Video,一个包含 3000 多段手术视频和 2500 万个标注帧的数据集,覆盖 11 个手术专科,数据来源于同行评审临床期刊;(ii) SurgLLaVA-Video,基于 TinyLLaVA-Video 架构构建的针对手术视频理解的专用 VLM,支持视频级和帧级输入;(iii) 涵盖 11 个手术专科(如血管、心脏和胸腔)的视频级手术视觉问答(VQA)基准。在所提出的基准和三个额外手术下游任务(动作识别、技能评估和三元组识别)上的大量实验表明,SurgLLaVA-Video 在参数仅为 30 亿的通用 VLM 和手术专用 VLM 基础上显著优于后者。该数据集、模型和基准将公开发布,以推动手术视频理解领域的进一步发展。

关键词

引用

@article{arxiv.2508.10054,
  title  = {SurgPub-Video: A Comprehensive Surgical Video Dataset for Enhanced Surgical Intelligence in Vision-Language Model},
  author = {Yaoqian Li and Xikai Yang and Dunyuan Xu and Yang Yu and Litao Zhao and Xiaowei Hu and Jinpeng Li and Pheng-Ann Heng},
  journal= {arXiv preprint arXiv:2508.10054},
  year   = {2026}
}