Motion2Vec:基于手术视频的半监督表示学习
机器人学
2020-06-02 v1 计算机视觉与模式识别
摘要
在嵌入空间中学习有意义的视觉表示有助于下游任务(如动作分割与模仿)的泛化。本文以半监督方式将手术视频演示分组为动作片段/子目标/选项,从而学习以运动为中心的手术视频表示。我们提出Motion2Vec算法,该算法通过最小化连体网络中的度量学习损失,从视频观测中学习深度嵌入特征空间:同一动作片段的图像被拉近,同时与从其他片段随机采样的图像推远,并尊重图像的时间顺序。在预训练连体网络后,针对给定的嵌入空间参数化,使用循环神经网络对嵌入进行迭代分割。我们仅使用一小部分带标签的视频片段来语义对齐嵌入空间,并通过推断所学模型参数对其余未标记数据赋予伪标签。我们展示了利用该表示从JIGSAWS数据集公开视频中模仿手术缝合运动的应用。结果平均分割准确率达85.5%,表明优于若干SOTA基线,而运动学姿态模仿在测试集上每观测的位置误差为0.94厘米。视频、代码和数据见 https://sites.google.com/view/motion2vec
引用
@article{arxiv.2006.00545,
title = {Motion2Vec: Semi-Supervised Representation Learning from Surgical Videos},
author = {Ajay Kumar Tanwani and Pierre Sermanet and Andy Yan and Raghav Anand and Mariano Phielipp and Ken Goldberg},
journal= {arXiv preprint arXiv:2006.00545},
year = {2020}
}
备注
IEEE International Conference on Robotics and Automation (ICRA), 2020