深度多模态嵌入:利用点云、语言与轨迹操控新物体
机器人学
2017-05-18 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
在真实环境中操作的机器人需要对视觉、语言和运动轨迹等多种传感器模态进行推理。然而,手动设计关联这些迥异模态的特征极具挑战性。在这项工作中,我们引入了一种算法,该算法学习利用深度神经网络将点云、自然语言和操控轨迹数据嵌入到一个共享的嵌入空间中。为了在整个网络中学习具有语义意义的空间,我们使用基于损失的间隔,将相关对的嵌入拉近,同时将来自不同模态的不太相关的案例推远。我们利用这一点来预训练其较低层并微调最终的嵌入空间,从而获得更鲁棒的表示。我们在基于对其他物体的先前经验来操控新物体和电器的任务上测试了我们的算法。在一个大型数据集上,我们在准确率和推理时间上都取得了相较于先前最优技术的显著提升。我们还利用学习到的嵌入空间在PR2机器人上进行了端到端实验。
引用
@article{arxiv.1509.07831,
title = {Deep Multimodal Embedding: Manipulating Novel Objects with Point-clouds, Language and Trajectories},
author = {Jaeyong Sung and Ian Lenz and Ashutosh Saxena},
journal= {arXiv preprint arXiv:1509.07831},
year = {2017}
}
备注
IEEE International Conference on Robotics and Automation (ICRA), 2017