中文

SurgOnAir:面向层级感知的实时外科视频解说

计算机视觉与模式识别 2026-05-21 v1

摘要

实时理解外科工作流程是智能外科具身化的基本要求,AI系统需在手术进行时持续感知并作出响应。在手术室中,关键决策依赖于细微的即时变化,如精细的仪器动作和不断演变的组织状态,甚至 slightest的感知延迟都可能限制辅助或危及安全。然而,现有方法仍为离线或以粗糙的时间尺度运行,仅在处理完片段后才生成描述,无法实现即时反应。我们通过提出SurgOnAir,一个流式视觉-语言模型,来解决此问题。该模型按帧顺序处理输入,无需未来信息,逐步生成解说token。SurgOnAir实现了从帧到token的细粒度生成,使其能够即时响应不断演变的外科动态。基于我们精选的分层数据集SurgOnAir-11k(覆盖动作、步骤和阶段层级的监督),模型被训练以产生反映外科程序内在层级结构的多层次文本响应。此外,设计了特殊的转换token,用于显式标记状态变化,使SurgOnAir能够捕捉并信号化 workflow 转换。实验表明,SurgOnAir通过单一的视觉-语言模型实现了跨多个层级的流式处理,生成优越且层级感知的解说。代码和数据集将公开。

关键词

引用

@article{arxiv.2605.21132,
  title  = {SurgOnAir: Hierarchy-Aware Real-Time Surgical Video Commentary},
  author = {Jingyi He and Yue Zhou and Long Bai and Kun Yuan and Nassir Navab and Yuan Bi},
  journal= {arXiv preprint arXiv:2605.21132},
  year   = {2026}
}