通过自监督深度强化学习学习推与抓之间的协同作用
机器人学
2018-10-02 v3 人工智能
计算机视觉与模式识别
机器学习
机器学习
摘要
熟练的机器人操作得益于非抓取(例如推)和抓取(例如抓)动作之间复杂的协同作用:推可以帮助重新排列杂乱的物体,为机械臂和手指腾出空间;同样,抓取可以帮助移动物体,使推的动作更精确且无碰撞。在这项工作中,我们证明了可以通过无模型深度强化学习从零开始发现并学习这些协同作用。我们的方法涉及训练两个全卷积网络,将视觉观察映射到动作:一个网络推断密集像素级采样的末端执行器方向和位置的推的效用,而另一个网络对抓取做同样的事情。这两个网络在 Q-learning 框架下联合训练,完全通过试错进行自监督,其中奖励来自成功的抓取。通过这种方式,我们的策略学习了能够实现未来抓取的推运动,同时学习了能够利用过去推的抓取。在模拟和真实世界场景的拣选实验中,我们发现我们的系统在具有挑战性的杂乱情况下能够快速学习复杂行为,并且仅需几个小时的训练即可实现比基线替代方案更好的抓取成功率和拣选效率。我们进一步证明了我们的方法能够泛化到新物体。定性结果(视频)、代码、预训练模型和模拟环境可在 http://vpg.cs.princeton.edu 获取。
引用
@article{arxiv.1803.09956,
title = {Learning Synergies between Pushing and Grasping with Self-supervised Deep Reinforcement Learning},
author = {Andy Zeng and Shuran Song and Stefan Welker and Johnny Lee and Alberto Rodriguez and Thomas Funkhouser},
journal= {arXiv preprint arXiv:1803.09956},
year = {2018}
}
备注
To appear at the International Conference On Intelligent Robots and Systems (IROS) 2018. Project webpage: http://vpg.cs.princeton.edu Summary video: https://youtu.be/-OkyX7ZlhiU