中文

SURGIVID:面向手术视频的对象发现的注释高效框架

计算机视觉与模式识别 2024-09-13 v1

摘要

手术场景传递着关乎手术质量的关键信息。对工具和解剖结构进行像素级定位是深入分析显微或内窥镜手术视图的第一步。这通常通过全监督方法实现,这些方法注释需求高,且在某些情况下需要医学专长。鉴于标准化手术工作流程获取的大量手术视频,我们提出了一个注释高效的框架,用于手术场景的语义分割。我们采用基于图像的自监督对象发现来识别手术视频中最突出的工具和解剖结构。这些提案在最小监督的微调步骤中进一步细化。仅需 36 条注释标签即可实现与全监督分割模型相当的局部分析性能。进一步地,利用手术阶段标签作为弱标签可更好地引导模型关注手术工具,实现约 2%\sim 2\% 的工具局部分析提升。在CaDIS 数据集上进行大量消融实验验证了我们方法在发现具有最小或无监督性的相关手术对象的有效性。

关键词

引用

@article{arxiv.2409.07801,
  title  = {SURGIVID: Annotation-Efficient Surgical Video Object Discovery},
  author = {Çağhan Köksal and Ghazal Ghazaei and Nassir Navab},
  journal= {arXiv preprint arXiv:2409.07801},
  year   = {2024}
}

备注

9 pages, 4 figures, 2 tables