深度视觉推理:从初始场景图像预测任务与运动规划的动作序列
机器学习
2020-06-11 v1 人工智能
计算机视觉与模式识别
机器人学
机器学习
摘要
在本文中,我们提出一种深度卷积循环神经网络,从初始场景图像预测任务与运动规划(TAMP)的动作序列。典型的TAMP问题通过将符号离散层(例如一阶逻辑)的推理与连续运动规划(如非线性轨迹优化)相结合来形式化。由于可能的离散动作序列具有巨大的组合复杂度,必须求解大量优化/运动规划问题才能找到解,这限制了这些方法的可扩展性。为规避该组合复杂度,我们开发了基于场景初始图像直接预测有前景的离散动作序列的神经网络,使得理想情况下只需求解一个运动规划问题即可找到整体TAMP问题的解。一个关键方面是我们的方法可泛化到具有许多且数量变化的物体的场景,尽管仅在每次两个物体上训练。这是通过将场景中的物体以图像形式编码作为神经网络输入,而非固定特征向量来实现的。结果显示运行时间改善了数个数量级。视频:https://youtu.be/i8yyEbbvoEk
引用
@article{arxiv.2006.05398,
title = {Deep Visual Reasoning: Learning to Predict Action Sequences for Task and Motion Planning from an Initial Scene Image},
author = {Danny Driess and Jung-Su Ha and Marc Toussaint},
journal= {arXiv preprint arXiv:2006.05398},
year = {2020}
}
备注
Robotics: Science and Systems (R:SS) 2020