中继策略学习:通过模仿与强化学习解决长时序任务
机器学习
2019-10-29 v1 机器人学
机器学习
摘要
我们提出中继策略学习(relay policy learning),一种能够解决多阶段、长时序机器人任务的模仿与强化学习方法。这一通用且普遍适用的两阶段方法包括:一个生成目标条件分层策略的模仿学习阶段,以及一个为任务表现微调这些策略的强化学习阶段。我们的方法虽然在模仿学习上未必完美,但非常易于通过环境交互进一步改进,从而能够扩展到具有挑战性的长时序任务。我们通过一种新颖的数据重标注算法来简化长时序策略学习问题,该算法用于学习目标条件分层策略,其中底层策略仅执行固定步数,而不论目标是否达成。虽然我们依赖示范数据来引导策略学习,但我们并不假设能够获得所求解的每个特定任务的示范,而是利用语义上有意义行为的非结构化且未分段的示范,这些示范不仅提供负担更小,而且能够极大促进使用强化学习的进一步改进。我们在具有挑战性的厨房仿真环境中的若干多阶段、长时序操作任务上展示了我们方法的有效性。视频见 https://relay-policy-learning.github.io/
引用
@article{arxiv.1910.11956,
title = {Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning},
author = {Abhishek Gupta and Vikash Kumar and Corey Lynch and Sergey Levine and Karol Hausman},
journal= {arXiv preprint arXiv:1910.11956},
year = {2019}
}
备注
Published at CoRL 2019