无需奖励工程的端到端机器人强化学习
机器学习
2019-05-17 v2 计算机视觉与模式识别
机器人学
机器学习
摘要
深度神经网络模型与强化学习算法的结合,使得学习直接读取原始感官输入(如相机图像)的机器人行为策略成为可能,从而有效地将估计与控制都纳入一个模型之中。然而,强化学习的实际应用必须通过手动编程的奖励函数来指定任务目标,这在实践中要么需要设计端到端强化学习本欲避免的同样的感知流水线,要么需要在环境中加装额外传感器以确定任务是否成功完成。在本文中,我们提出了一种方法,通过让机器人从少量成功结果示例中学习,随后主动征求查询(机器人向用户展示某个状态并询问标签以判断该状态是否代表任务成功完成),来消除手动设计奖励规范的需要。虽然为每个状态请求标签等同于让用户手动提供奖励信号,我们的方法在训练期间只需对极小部分所见状态进行标注,使其成为无需手动设计奖励即可学习技能的高效实用方法。我们在真实世界机器人操作任务上评估了我们的方法,其中观测由机器人相机所视图像组成。在我们的实验中,我们的方法直接从图像中学习摆放物体、放书和披布,无任何手动指定的奖励函数,且仅需与真实世界交互1-4小时。
引用
@article{arxiv.1904.07854,
title = {End-to-End Robotic Reinforcement Learning without Reward Engineering},
author = {Avi Singh and Larry Yang and Kristian Hartikainen and Chelsea Finn and Sergey Levine},
journal= {arXiv preprint arXiv:1904.07854},
year = {2019}
}
备注
Accepted to RSS 2019. 14 pages and 13 figures including references and appendix. Website: https://sites.google.com/view/reward-learning-rl/home