中文

GoalsEye:在物理机器人上学习高速精准乒乓球

机器人学 2022-10-17 v2

摘要

在真实世界中学习目标条件控制是机器人领域一个具挑战性的开放问题。强化学习系统有潜力通过试错自主地学习,但在实践中,人工奖励设计、确保安全探索以及超参数调优的代价往往足以阻碍真实世界部署。另一方面,模仿学习方法为真实世界控制学习提供了简单途径,但通常需昂贵的精选示范数据,且缺乏持续改进机制。近来,迭代模仿技术已被证明能从非定向示范数据学习目标导向控制,并通过自监督目标到达持续改进,但迄今结果仅限于仿真环境。本工作中,我们给出证据:迭代模仿学习可扩展到动态设定下真实机器人的目标导向行为——高速精准乒乓球(如“将球落在该特定目标点”)。我们发现该方法提供了一种直接的持续在机器人上学习方式,无奖励设计或 sim-to-real 迁移等复杂性。它也具可扩展性——样本高效到仅数小时便可在物理机器人上训练。在真实世界评估中,我们发现所得策略在将球回至桌上特定目标点的任务上表现与业余人类(从机器人实验室随机取样玩家)相当或更优。最后,我们分析初始非定向引导数据集大小对性能的影响,发现前期提供的适量非结构化示范数据极大加速通用目标到达策略的收敛。见 https://sites.google.com/view/goals-eye 获取视频。

关键词

引用

@article{arxiv.2210.03662,
  title  = {GoalsEye: Learning High Speed Precision Table Tennis on a Physical Robot},
  author = {Tianli Ding and Laura Graesser and Saminda Abeyruwan and David B. D'Ambrosio and Anish Shankar and Pierre Sermanet and Pannag R. Sanketi and Corey Lynch},
  journal= {arXiv preprint arXiv:2210.03662},
  year   = {2022}
}