中文

基于标签插值的手术视频理解

计算机视觉与模式识别 2026-03-17 v2

摘要

机器人辅助手术(RAS)已成为现代手术的关键范式,通过微创方法促进患者康复并减轻外科医生的负担。然而,要充分发挥其潜力,必须对手术过程中产生的视觉数据进行精确理解。以往研究主要集中于单任务方法,但真实手术场景涉及复杂的时序动态和多样的器械交互,限制了全面理解。此外,多任务学习(MTL)的有效应用需要充足的像素级分割数据,而标注的高成本和专业性要求使得这些数据难以获取。具体而言,相位和步骤等长期标注可用于每一帧,而手术器械分割和动作检测等短期标注仅提供于关键帧,导致显著的时空不平衡。为应对这些挑战,我们提出了一种将基于光流的分割标签插值与多任务学习相结合的新框架。从标注关键帧估计的光流被用于将标签传播至相邻的未标注帧,从而丰富稀疏的空间监督并平衡训练的时空信息。这种整合提高了手术场景理解的准确性和效率,进而增强了 RAS 的实用性。

关键词

引用

@article{arxiv.2509.18802,
  title  = {Surgical Video Understanding with Label Interpolation},
  author = {Garam Kim and Tae Kyeong Jeong and Juyoun Park},
  journal= {arXiv preprint arXiv:2509.18802},
  year   = {2026}
}

备注

Accepted to ICRA 2026. Video: https://youtu.be/24LlhqvgFBU | Dataset: https://huggingface.co/datasets/KIST-HARILAB/MISAW-Seg