通过无监督离策略强化学习涌现的实世界机器人技能
机器人学
2020-04-28 v1 机器学习
摘要
强化学习提供了一种通用框架,可在最小化工程投入的同时学习机器人技能。然而,大多数强化学习算法假设提供了精心设计的奖励函数,并针对该单一奖励函数学习单一行为。此类奖励函数在实践中可能难以设计。我们能否转而开发高效的强化学习方法,在无任何奖励函数的情况下习得多样技能,并将这些技能用于下游任务?本文中,我们展示最近提出的无监督技能发现算法可扩展为一种高效的离策略方法,使其适用于在真实世界中进行无监督强化学习。首先,我们表明所提算法在学习效率上有实质提升,使无奖励的真实世界训练可行。其次,我们超越仿真环境,在真实物理硬件上评估该算法。在四足机器人上,我们观察到具有多样步态和不同朝向的运动技能在无任何奖励或演示的情况下涌现。我们还展示所学技能可使用模型预测控制进行组合,以实现目标导向导航,且无需任何额外训练。
引用
@article{arxiv.2004.12974,
title = {Emergent Real-World Robotic Skills via Unsupervised Off-Policy Reinforcement Learning},
author = {Archit Sharma and Michael Ahn and Sergey Levine and Vikash Kumar and Karol Hausman and Shixiang Gu},
journal= {arXiv preprint arXiv:2004.12974},
year = {2020}
}