中文

用于手术手势识别的有界未来 MS-TCN++

计算机视觉与模式识别 2022-10-07 v2 人工智能

摘要

近来,基于视频的手术应用不断发展。其中部分应用可在手术结束后离线工作,其他应用必须立即响应。然而,有些情况下响应应在手术期间完成但允许一定延迟。文献中已知在线-离线性能差距。本研究的目标是学习性能-延迟权衡并设计一种基于 MS-TCN++ 的算法以利用该权衡。为此,我们使用公开的手术模拟数据集,包含 24 名参与者在可变组织模拟器上进行缝合任务的 96 个视频。本研究中,我们使用从侧视捕获的视频数据。网络被训练以识别所执行的手术手势。朴素方法是减少 MS-TCN++ 深度,从而减少感受野,所需未来帧数也随之减少。我们表明该方法非最优,尤其在小延迟情况下。第二种方法是在每个时间卷积中限制可访问的未来。由此,我们在网络设计上具有灵活性,并取得了显著优于朴素方法的性能。

关键词

引用

@article{arxiv.2209.14647,
  title  = {Bounded Future MS-TCN++ for surgical gesture recognition},
  author = {Adam Goldbraikh and Netanell Avisdris and Carla M. Pugh and Shlomi Laufer},
  journal= {arXiv preprint arXiv:2209.14647},
  year   = {2022}
}

备注

17 pages, 7 figures, 1 table, Accepted to ECCV-MCV