利用奖励草图与批量强化学习扩展数据驱动机器人
机器人学
2020-06-05 v3 机器学习
摘要
我们提出一种数据驱动机器人框架,其利用大规模已记录机器人经验数据集,并通过学习奖励函数扩展至若干任务。我们展示如何应用该框架在真实机器人平台上完成三项不同的物体操控任务。给定一项任务的演示以及任务无关的已记录经验,我们使用一种特殊形式的人类标注作为监督来学习奖励函数,这使我们能处理无法直接获取奖励信号的实际任务。习得的奖励与来自不同任务的大规模经验数据集相结合,使用批量 RL 离线学习机器人策略。我们表明,使用我们的方法可以训练智能体执行多种具有挑战性的操控任务,包括刚体堆叠与布料处理。
引用
@article{arxiv.1909.12200,
title = {Scaling data-driven robotics with reward sketching and batch reinforcement learning},
author = {Serkan Cabi and Sergio Gómez Colmenarejo and Alexander Novikov and Ksenia Konyushkova and Scott Reed and Rae Jeong and Konrad Zolna and Yusuf Aytar and David Budden and Mel Vecerik and Oleg Sushkov and David Barker and Jonathan Scholz and Misha Denil and Nando de Freitas and Ziyu Wang},
journal= {arXiv preprint arXiv:1909.12200},
year = {2020}
}
备注
Project website: https://sites.google.com/view/data-driven-robotics/