中继后见之明经验回放:用于稀疏奖励序贯物体操纵任务的自引导持续强化学习
机器人学
2022-11-04 v2 人工智能
摘要
稀疏奖励下的探索仍是强化学习 (RL) 中一个具有挑战性的研究问题。特别是对于序贯物体操纵任务,RL 智能体在完成所有子任务之前总是收到负奖励,这导致探索效率低下。为高效解决这些任务,我们提出了一种新颖的自引导持续 RL 框架,RelayHER (RHER)。RHER 首先利用后见之明经验回放 (HER) 将序贯任务分解为复杂度递增的新子任务,并确保最简单的子任务能被快速学习。其次,我们设计了一个多目标多任务网络来同时学习这些子任务。最后,我们提出一种自引导探索策略 (SGES)。借助 SGES,已学习的子任务策略将引导智能体到达有助于利用 HER 学习更复杂子任务的状态。通过这种自引导探索和接力策略学习,RHER 能分阶段高效地解决这些序贯任务。实验结果表明,在五个单物体和五个复杂多物体操纵任务(如 Push、Insert、ObstaclePush、Stack、TStack 等)上,RHER 的样本效率显著优于 vanilla-HER。所提出的 RHER 还被应用于从零开始在物理机器人上学习富含接触的推动任务,仅用 250 个回合成功率即达到 10/10。
引用
@article{arxiv.2208.00843,
title = {Relay Hindsight Experience Replay: Self-Guided Continual Reinforcement Learning for Sequential Object Manipulation Tasks with Sparse Rewards},
author = {Yongle Luo and Yuxin Wang and Kun Dong and Qiang Zhang and Erkang Cheng and Zhiyong Sun and Bo Song},
journal= {arXiv preprint arXiv:2208.00843},
year = {2022}
}
备注
10 pages, 15 figures. https://github.com/kaixindelele/RHER