中文

EndoNet:一种用于腹腔镜视频识别任务的深度架构

计算机视觉与模式识别 2016-05-24 v2

摘要

手术工作流识别具有众多潜在医疗应用,例如手术视频数据库的自动索引与实时手术室调度的优化等。因此,相位识别已在多种手术背景下被研究,如白内障、神经与腹腔镜手术。文献中通常使用两类特征来执行该任务:视觉特征与工具使用信号。然而,所用的视觉特征大多是手工设计的。此外,工具使用信号通常通过手动标注过程或利用额外设备收集。本文中,我们提出一种新颖的相位识别方法,其使用卷积神经网络(CNN)从胆囊切除术视频中自动学习特征,并且仅依赖于视觉信息。在先前研究中,已表明工具信号可在执行相位识别任务时提供有价值信息。因此,我们提出一种称为EndoNet的新颖CNN架构,其设计用于以多任务方式执行相位识别与工具存在检测任务。据我们所知,这是首个提出将CNN用于腹腔镜视频上多个识别任务的工作。与其他方法的广泛实验比较表明EndoNet对两项任务均产生最先进结果。

关键词

引用

@article{arxiv.1602.03012,
  title  = {EndoNet: A Deep Architecture for Recognition Tasks on Laparoscopic Videos},
  author = {Andru P. Twinanda and Sherif Shehata and Didier Mutter and Jacques Marescaux and Michel de Mathelin and Nicolas Padoy},
  journal= {arXiv preprint arXiv:1602.03012},
  year   = {2016}
}

备注

Video: https://www.youtube.com/watch?v=6v0NWrFOUUM