面向手术上下文推断与手势转换的研究
计算机视觉与模式识别
2023-03-17 v2 机器学习
机器人学
摘要
在机器人辅助手术中,手势的人工标注耗时费力、易出错,且需要专业知识或培训。我们提出了一种自动化且可解释的手势记录生成方法,该方法利用了丰富的图像分割数据。通过检查工具与物体之间的距离和交集,利用分割掩码来检测手术上下文。接下来,使用基于知识的有限状态机(FSM)和数据驱动的长短期记忆(LSTM)模型,将上下文标签转换为手势记录。通过将结果与 JIGSAWS 数据集中的真值分割掩码、共识上下文标签以及手势标签进行比较,我们评估了该方法每个阶段的性能。结果表明,我们的分割模型在缝合任务中的针与线识别上达到了 SOTA 性能,并且我们能够自动检测重要的手术状态,与众包标签具有高度一致性(例如,缝合任务中抓持器与物体的接触)。我们还发现,与 LSTM 相比,FSM 模型对较差的分割和标注性能具有更强的鲁棒性。我们提出的方法可以显著缩短手势标注过程(约2.8倍)。
引用
@article{arxiv.2302.14237,
title = {Towards Surgical Context Inference and Translation to Gestures},
author = {Kay Hutchinson and Zongyu Li and Ian Reyes and Homa Alemzadeh},
journal= {arXiv preprint arXiv:2302.14237},
year = {2023}
}
备注
accepted for the 2023 International Conference on Robotics and Automation (ICRA)