基于多模态数据的手术手势分割与识别分层半监督学习框架
计算机视觉与模式识别
2023-08-08 v1
摘要
将手术操作轨迹分割并识别为不同的有意义手势,是机器人辅助手术工作流分析的关键预备步骤。该步骤对于促进自主机器人手术中的示范学习、评估手术技能等是必要的。本工作中,我们开发了基于多模态数据(即运动学与视觉数据)的手术手势分割分层半监督学习框架。更具体地,首先利用运动学数据构建的基于距离特征的轮廓与基于方差特征的轮廓对手术任务进行初步分割。随后,使用带有预训练 `ResNet-18' 骨干的基于 Transformer 的网络从手术操作视频中提取视觉特征。通过结合两模态获得的潜在分割点,我们可确定最终分割点。此外,手势识别可基于监督学习实现。所提方法已使用公开可用的 JIGSAWS 数据库(包括缝合、穿针与打结任务)的数据进行评估。结果显示分割的平均 F1 分数为 0.623,识别准确率为 0.856。
引用
@article{arxiv.2308.02529,
title = {Hierarchical Semi-Supervised Learning Framework for Surgical Gesture Segmentation and Recognition Based on Multi-Modality Data},
author = {Zhili Yuan and Jialin Lin and Dandan Zhang},
journal= {arXiv preprint arXiv:2308.02529},
year = {2023}
}
备注
8 pages, 7 figures. Accepted by 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2023). For more details about this paper, please visit our website: \url{https://sites.google.com/view/surseg/home}