COG: 通过离线强化学习将新技能与过往经验相连接
机器学习
2020-10-28 v1 机器人学
摘要
强化学习已被应用于广泛的机器人问题,但此类应用大多涉及为每个新任务从头收集数据。由于我们能对任何单一任务收集的机器人数据量受时间与成本限制,所学行为通常较狭窄:策略只能在训练所用的少数场景中执行任务。如果存在一种方法能融入大量先验数据,无论是来自先前已解决的任务,还是来自无监督或无方向的环境交互,以扩展并泛化学到的行为,会怎样?虽然多数利用预收集数据扩展机器人技能的先前工作聚焦于构建显式层次结构或技能分解,我们在本文中展示可仅通过动态规划重用先验数据来扩展新技能。我们表明,即使先验数据实际上并未成功解决新任务,它仍可通过为智能体提供对其环境机制的更广阔理解而用于学习更好的策略。我们通过将先验数据集中见到的若干行为链式连接以解决新任务来展示我们方法的有效性,其中最困难的实验设定涉及连续组合四项机器人技能:抓取、放置、抽屉开启与握持,仅在任务完成时提供 +1/0 稀疏奖励。我们以端到端方式训练策略,将高维图像观测映射到低层机器人控制指令,并在模拟与真实世界域中呈现结果。附加材料与源代码可见于我们的项目网站:https://sites.google.com/view/cog-rl
引用
@article{arxiv.2010.14500,
title = {COG: Connecting New Skills to Past Experience with Offline Reinforcement Learning},
author = {Avi Singh and Albert Yu and Jonathan Yang and Jesse Zhang and Aviral Kumar and Sergey Levine},
journal= {arXiv preprint arXiv:2010.14500},
year = {2020}
}
备注
Accepted to CoRL 2020. Source code and videos available at https://sites.google.com/view/cog-rl