中文

基于二值奖励的真实世界杂耍高加速度强化学习

机器人学 2020-11-03 v3 机器学习 机器学习

摘要

能够在物理世界中学习的机器人对于使机器人摆脱僵硬的预编程运动至关重要。对于诸如杂耍之类的动态高加速度任务,在真实世界中学习尤其具有挑战性,因为必须在不损害系统的情况下逼近机器人及其驱动的极限,这放大了机器人学习算法对样本效率与安全性的需求。与主要关注学习算法的已有工作不同,我们提出了一种学习系统,将此类需求直接纳入策略表示、初始化与优化的设计中。我们展示了该系统使高速 Barrett WAM 机械臂能够从 56 分钟经验中借助二值奖励信号学会杂耍两个球。最终策略可连续杂耍长达 33 分钟或约 4500 次重复接球。记录学习过程与评估的视频可在 https://sites.google.com/view/jugglingbot 查看。

关键词

引用

@article{arxiv.2010.13483,
  title  = {High Acceleration Reinforcement Learning for Real-World Juggling with Binary Rewards},
  author = {Kai Ploeger and Michael Lutter and Jan Peters},
  journal= {arXiv preprint arXiv:2010.13483},
  year   = {2020}
}

备注

Published at Conference on Robot Learning (CoRL) 2020