中文

基于多模态最优传输的无监督手术机器人时序分割框架

计算机视觉与模式识别 2026-05-21 v2 人工智能

摘要

手术阶段和步骤的自动识别是机器人辅助手术中内operative 决策支持、工作流程自动化和技能评估的基本能力。现有方法要么依赖大规模标注的手术数据集,要么需要在数千段标注视频上进行高昂的领域特定预训练,限制了其在不同机器人平台和临床环境中的实际部署。本文提出 TASOT(Text-Augmented Action Segmentation Optimal Transport),一个无需任务特定标注或手术领域预训练的无监督手术时序分割框架。TASOT 将 Action Segmentation Optimal Transport (ASOT) 公式扩展,通过融合来自输入视频直接生成的准时序文本描述,将视觉与语义线索整合到统一的非平衡 Gromov-Wasserstein 最优传输目标中。视觉表征使用 DINOv3 提取,时间轴文本描述通过 CLIP 编码并准时对齐到 individual 帧,为传输成本提供互补的语义结构。我们在三个公开手术数据集上进行评估,涵盖腔镜手术和机器人手术的四个基准设置,显示出对最强零样本基线的显著提升:Cholec80 上 F1 提升 18.9,AutoLaparo 提升 33.7,StrasByPass70 提升 23.7,BernByPass70 提升 4.5。这些结果表明,在不依赖手动训练标注或手术特定预训练管道的情况下,能够实现机器人手术环境中细粒度手术工作流程理解,为实际机器人手术系统提供了有前景的替代方案。

关键词

引用

@article{arxiv.2602.24138,
  title  = {Multimodal Optimal Transport for Training-free Temporal Segmentation in Surgical Robotics},
  author = {Omar Mohamed and Edoardo Fazzari and Ayah Al-Naji and Hamdan Alhadhrami and Khalfan Hableel and Saif Alkindi and Ivan Laptev and Cesare Stefanini},
  journal= {arXiv preprint arXiv:2602.24138},
  year   = {2026}
}