利用肌肉机器人从零开始学习打乒乓球
机器人学
2020-06-11 v1 机器学习
摘要
像乒乓球这样的动态任务对人类来说相对容易学习,但对机器人却构成重大挑战。此类任务需要在飞行球和机器人的状态估计不精确的情况下,对快速运动进行准确控制并精确计时。强化学习(Reinforcement Learning, RL)在从数据中学习复杂控制任务方面已展现出潜力。然而,将基于步的 RL 应用于真实系统中的动态任务具有安全关键性,因为 RL 需要在高速状态下安全地探索并失败数百万时间步。在本文中,我们证明通过使用由气动人工肌肉(PAMs)驱动的机械臂,可以实现使用无模型强化学习安全学习乒乓球。PAMs 的柔顺性和可反向驱动特性防止系统离开其状态空间的安全区域。以此方式,RL 使机器人能够以平均 5 m/s 和 12 m/s 的速度将真实球回击和扣杀至期望落点。我们的设置允许智能体学习这一安全关键任务:(i) 算法中无安全约束,(ii) 在奖励函数中直接最大化回球速度,(iii) 使用直接作用于真实系统底层控制的随机策略,(iv) 训练数千次试验,(v) 从零开始无任何先验知识。此外,我们提出 HYSR,一种实用的混合仿真与真实训练方法,通过在仿真中随机重放记录下的球轨迹并对真实机器人施加动作,避免在训练期间打真实球。本工作是首个 (a) 使用拟人机械臂对安全关键动态任务进行故障安全学习,(b) 尽管存在控制挑战仍使用 PAM 驱动系统学习高精度要求问题,以及 (c) 训练机器人不打真实球而打乒乓球的工作。视频与数据集可在 muscularTT.embodied.ml 获取。
引用
@article{arxiv.2006.05935,
title = {Learning to Play Table Tennis From Scratch using Muscular Robots},
author = {Dieter Büchler and Simon Guist and Roberto Calandra and Vincent Berenz and Bernhard Schölkopf and Jan Peters},
journal= {arXiv preprint arXiv:2006.05935},
year = {2020}
}
备注
11 pages, 8 figures. Submitted to T-RO. For more information visit https://muscularTT.embodied.ml