用于手术机器人中自动手势识别的多模态自监督表示学习
计算机视觉与模式识别
2020-11-03 v1 机器学习
机器人学
摘要
自监督多模态学习已在复杂场景的整体表示中取得成功。这有助于整合来自多模态的信息,这些模态具有多种通用用途。其在手术机器人中的应用可同时实现对手术过程的通用机器理解,并减少对通常难以获取的优质专家标注的依赖。我们开发了一种自监督多模态表示学习范式,从视频和运动学中学习手术手势的表示。我们采用编码器-解码器网络结构,从手术视频中编码表示并解码以生成运动学。我们定量展示了所学表示在手势识别(准确率介于69.6%与77.8%之间)、跨多任务的迁移学习(准确率介于44.6%与64.8%之间)以及外科医生技能分类(准确率介于76.8%与81.2%之间)上的有效性。此外,我们定性地展示了我们的自监督表示在语义有意义的属性(外科医生技能与手势)上形成聚类。
引用
@article{arxiv.2011.00168,
title = {Multimodal and self-supervised representation learning for automatic gesture recognition in surgical robotics},
author = {Aniruddha Tamhane and Jie Ying Wu and Mathias Unberath},
journal= {arXiv preprint arXiv:2011.00168},
year = {2020}
}
备注
15 pages, 7 figures