基于多数据源深度学习的手术子任务时间分割
计算机视觉与模式识别
2020-02-10 v1 机器学习
机器人学
图像与视频处理
摘要
机器人辅助手术(RAS)中的许多任务可用有限状态机(FSMs)表示,其中每个状态代表一个动作(如拾取缝针)或一种观测(如出血)。实现此类手术任务自动化的关键一步是对当前手术场景的时间感知,这需要对 FSMs 中的状态进行实时估计。本工作的目标是依据任务推进中所执行的动作或发生的事件估计手术任务的当前状态。我们提出 Fusion-KVE,一种融合运动学、视觉与系统事件等多数据源的统一手术状态估计模型。此外,我们考察了不同状态估计模型在分割具有不同代表性特征或粒度级别的状态时的优势与局限。我们在 JHU-ISI Gesture and Skill Assessment Working Set (JIGSAWS) 以及使用 da Vinci Xi 手术系统创建的、涉及机器人术中超声(RIOUS)成像的更复杂数据集上评估了我们的模型。我们的模型取得了高达 89.4% 的帧级状态估计准确率,在 JIGSAWS 缝合数据集与我们的 RIOUS 数据集上均优于当前最优的手术状态估计模型。
引用
@article{arxiv.2002.02921,
title = {Temporal Segmentation of Surgical Sub-tasks through Deep Learning with Multiple Data Sources},
author = {Yidan Qin and Sahba Aghajani Pedram and Seyedshams Feyzabadi and Max Allan and A. Jonathan McLeod and Joel W. Burdick and Mahdi Azizian},
journal= {arXiv preprint arXiv:2002.02921},
year = {2020}
}
备注
Accepted to ICRA 2020