中文

基于视频与外科工具姿态信息的多模态手势识别:动作不变性方法

计算机视觉与模式识别 2025-03-21 v1 机器学习

摘要

实时识别外科手势是实现自动化活动识别、技能评估、手术中期辅助以及最终的外科自动化的关键步骤。当前的机器人外科系统提供了丰富的多模态数据,如视频和运动学数据。虽然近期一些多模态神经网络研究尝试学习视觉与运动学数据之间的关系,但现有方法将运动学信息视为独立信号,未考虑工具尖端姿态之间存在的内在关联。仪器姿态在几何上是相互关联的,其几何特性可为神经网络学习手势表征提供有益线索。因此,我们提出将动作不变性度量(曲率与扭率)与视觉与运动学数据结合,通过关系图网络捕捉不同数据流之间的内在关系。我们表明,结合不变信号与工具位置信息后,手势识别性能得到提升,在JIGSAWS缝合数据集上实现了90.3%的帧级准确率。我们的结果表明,动作不变信号结合位置信息是手势运动的更佳表征方式,相较于传统的位置与四元数表示。我们的研究结果凸显了在手势识别中对运动学进行几何感知建模的必要性。

关键词

引用

@article{arxiv.2503.15647,
  title  = {Multi-Modal Gesture Recognition from Video and Surgical Tool Pose Information via Motion Invariants},
  author = {Jumanh Atoum and Garrison L. H. Johnston and Nabil Simaan and Jie Ying Wu},
  journal= {arXiv preprint arXiv:2503.15647},
  year   = {2025}
}