V2CNet:一种将视频翻译为机器人操作指令的深度学习框架
计算机视觉与模式识别
2019-03-27 v1 机器人学
摘要
我们提出 V2CNet,一种新颖的深度学习框架,用于自动将演示视频翻译为可直接用于机器人应用的指令。我们的 V2CNet 具有两个分支,旨在以细粒度方式理解演示视频。第一个分支采用编码器-解码器架构来编码视觉特征并顺序生成作为指令的输出词,而第二个分支使用时间卷积网络(TCN)来学习细粒度动作。通过联合训练两个分支,该网络能够建模指令的序列信息,同时有效编码细粒度动作。在我们新构建的大规模数据集上的实验结果表明,V2CNet 以显著优势优于近期最先进(SOTA)方法,且其输出可应用于真实机器人应用中。源代码与训练好的模型将公开提供。
引用
@article{arxiv.1903.10869,
title = {V2CNet: A Deep Learning Framework to Translate Videos to Commands for Robotic Manipulation},
author = {Anh Nguyen and Thanh-Toan Do and Ian Reid and Darwin G. Caldwell and Nikos G. Tsagarakis},
journal= {arXiv preprint arXiv:1903.10869},
year = {2019}
}
备注
15 pages. arXiv admin note: substantial text overlap with arXiv:1710.00290