用于腹腔镜手术早期类型识别的未来状态预测 LSTM
计算机视觉与模式识别
2019-09-06 v2
摘要
本文提出了一种从视频中早期识别腹腔镜手术类型的新方法。早期识别算法有助于开发能够提供自动上下文感知辅助的“智能”手术室系统,并支持快速的数据库索引。然而,该任务面临着属于腹腔镜领域的视频所特有的挑战,例如手术间的高视觉相似性和视频时长的巨大差异。为了捕捉这些视频中的时空依赖关系,我们选择了卷积神经网络(CNN)与长短期记忆(LSTM)网络相结合作为模型。随后我们提出两种互补的方法来改善早期识别性能。第一种方法是一种 CNN 微调方法,鼓励基于腹腔镜视频的初始帧来区分手术。第二种方法被称为“未来状态预测 LSTM”,训练一个 LSTM 来预测与未来帧相关的信息,这有助于区分不同类型的手术。我们在一个包含 9 类手术、共 425 个腹腔镜视频的大型数据集(Laparo425)上评估了我们的方法,在仅观察到手术前 10 分钟的情况下平均达到了 75% 的准确率。从实际角度来看,这些结果相当有前景,对其他类型的图像引导手术也具有鼓舞意义。
引用
@article{arxiv.1811.11727,
title = {Future-State Predicting LSTM for Early Surgery Type Recognition},
author = {Siddharth Kannan and Gaurav Yengera and Didier Mutter and Jacques Marescaux and Nicolas Padoy},
journal= {arXiv preprint arXiv:1811.11727},
year = {2019}
}
备注
12 pages, 11 figures