中文

丰富手术视频数据集以实现视觉语言模型的细粒度时空理解的方法

计算机视觉与模式识别 2026-04-02 v1

摘要

手术视频理解是推进计算机辅助手术的关键前提。虽然视觉语言模型(VLMs)最近已应用于手术领域,但现有的手术视觉语言数据集缺乏捕捉和评估复杂交错时空动态的能力。创建准确表示手术视频中细粒度时空关系的大规模数据集具有挑战性,因为手动标注成本高昂或使用大语言模型生成容易出错。为填补这一空白,我们引入了 SurgSTU-Pipeline,一个确定性生成流水线,具有时空连续性过滤功能,可可靠地创建用于细粒度时空多模态理解的手术数据集。将该流水线应用于公开可用的手术数据集,我们创建了 SurgSTU 数据集,包含 7515 个视频片段,密集扩展了 15 万个细粒度时空问答样本。我们的综合评估表明,虽然最先进的一般 VLM 在零样本设置中表现不佳,但其时空能力可通过上下文学习得到提升。在 SurgSTU 训练数据集上微调的 VLM 在所有时空任务中取得了最高性能,验证了该数据集在提升手术视频中 VLMs 时空理解方面的有效性。代码将公开发布。

关键词

引用

@article{arxiv.2604.00784,
  title  = {An Approach to Enriching Surgical Video Datasets for Fine-Grained Spatial-Temporal Understanding of Vision-Language Models},
  author = {Lennart Maack and Alexander Schlaefer},
  journal= {arXiv preprint arXiv:2604.00784},
  year   = {2026}
}