强化学习的逆向课程生成
人工智能
2018-07-24 v3 机器学习
神经与进化计算
机器人学
摘要
许多相关任务要求智能体达到特定状态,或将物体操纵至期望配置。例如,我们可能希望机器人将齿轮对准并组装到轴上,或将钥匙插入锁中并转动。这些面向目标的任务对强化学习提出了巨大挑战,因为其自然奖励函数是稀疏的,且需要大量的探索才能达到目标并获得学习信号。过去的方法通过利用专家演示或手动设计特定任务的奖励整形函数来引导学习智能体,从而解决这些问题。相反,我们提出了一种学习这些任务的方法,除了获取任务已完成的单个状态外,不需要任何先验知识。机器人以逆向方式训练,逐渐学习从一组距离目标越来越远的起始状态到达目标。我们的方法自动生成适应智能体性能的起始状态课程,从而实现面向目标任务的高效训练。我们在难以模拟的导航和细粒度操纵问题上展示了我们的方法,这些问题是现有最先进的强化学习方法无法解决的。
引用
@article{arxiv.1707.05300,
title = {Reverse Curriculum Generation for Reinforcement Learning},
author = {Carlos Florensa and David Held and Markus Wulfmeier and Michael Zhang and Pieter Abbeel},
journal= {arXiv preprint arXiv:1707.05300},
year = {2018}
}
备注
Published at the 1st Conference on Robot Learning (CoRL 2017)