中文

用于手术机器人中自动手势识别的多模态自监督表示学习

计算机视觉与模式识别 2020-11-03 v1 机器学习 机器人学

摘要

自监督多模态学习已在复杂场景的整体表示中取得成功。这有助于整合来自多模态的信息,这些模态具有多种通用用途。其在手术机器人中的应用可同时实现对手术过程的通用机器理解,并减少对通常难以获取的优质专家标注的依赖。我们开发了一种自监督多模态表示学习范式,从视频和运动学中学习手术手势的表示。我们采用编码器-解码器网络结构,从手术视频中编码表示并解码以生成运动学。我们定量展示了所学表示在手势识别(准确率介于69.6%与77.8%之间)、跨多任务的迁移学习(准确率介于44.6%与64.8%之间)以及外科医生技能分类(准确率介于76.8%与81.2%之间)上的有效性。此外,我们定性地展示了我们的自监督表示在语义有意义的属性(外科医生技能与手势)上形成聚类。

关键词

引用

@article{arxiv.2011.00168,
  title  = {Multimodal and self-supervised representation learning for automatic gesture recognition in surgical robotics},
  author = {Aniruddha Tamhane and Jie Ying Wu and Mathias Unberath},
  journal= {arXiv preprint arXiv:2011.00168},
  year   = {2020}
}

备注

15 pages, 7 figures