中文

基于视觉语言模型的手术工作流程表示学习方法(ReSW-VL)

计算机视觉与模式识别 2025-05-21 v1 图像与视频处理

摘要

从视频中识别手术阶段是一种自动对手术程序进展进行分类的技术,具有广泛的潜在应用,包括实时手术支持、医疗资源优化、培训与技能评估以及安全性提高。近期的手术阶段识别技术主要聚焦于基于Transformer的方法,尽管使用CNN从单个帧中提取空间特征,然后使用时间序列建模从这些空间特征的时间序列中提取视频特征的方法显示出高性能。然而,仍缺乏关于用于手术阶段识别中CNN特征提取或表示学习的训练方法的研究。在本研究中,我们提出了一种使用视觉语言模型(ReSW-VL)进行手术工作流程表示学习的方法。我们的方法涉及使用提示学习对CLIP(Convolutional Language Image Model)视觉语言模型的图像编码器进行微调,以实现手术阶段识别。在三个手术阶段识别数据集上的实验结果表明,所提方法在比较传统方法时有效性显著。

关键词

引用

@article{arxiv.2505.13746,
  title  = {ReSW-VL: Representation Learning for Surgical Workflow Analysis Using Vision-Language Model},
  author = {Satoshi Kondo},
  journal= {arXiv preprint arXiv:2505.13746},
  year   = {2025}
}