PlanGAN:基于模型的多目标稀疏奖励规划
机器学习
2020-06-02 v1 人工智能
机器学习
摘要
在强化学习(RL)中,使用稀疏奖励进行学习仍然是一个重大挑战,特别是当目标是训练出能够实现多个不同目标的策略时。迄今为止,处理多目标、稀疏奖励环境最成功的方法一直是免模型 RL 算法。在这项工作中,我们提出 PlanGAN,一种专门设计用于解决具有稀疏奖励环境中多目标任务的基于模型的算法。我们的方法建立在以下事实之上:智能体收集的任何经验轨迹都包含关于如何实现该轨迹期间观察到的目标的有用信息。我们利用这一点训练一组条件生成模型(GANs)来生成合理的轨迹,引导智能体从当前状态走向指定目标。然后我们将这些想象出的轨迹组合成一种新颖的规划算法,以尽可能高效地实现期望目标。PlanGAN 的性能已在若干机器人导航/操纵任务上进行了测试,并与一系列免模型强化学习基线(包括 Hindsight Experience Replay)进行比较。我们的研究表明,PlanGAN 可以达到相当的性能,同时样本效率约高出 4-8 倍。
引用
@article{arxiv.2006.00900,
title = {PlanGAN: Model-based Planning With Sparse Rewards and Multiple Goals},
author = {Henry Charlesworth and Giovanni Montana},
journal= {arXiv preprint arXiv:2006.00900},
year = {2020}
}