利用生成模型通过不完全示范塑造强化学习奖励函数
机器人学
2020-11-04 v1 机器学习
摘要
无模型强化学习对真实机器人系统的潜在益处受其盲目探索的限制,后者导致收敛缓慢、数据效率低下以及与环境的多余交互。为应对这些缺陷,我们提出一种结合强化学习与模仿学习的方法,通过使用生成模型从示范数据中训练得到的状态与动作相关势函数来塑造奖励函数。我们表明,该方法通过指定值得优先探索的状态与动作空间中的高价值区域,加速了策略学习。与大多数假设最优示范并将示范数据作为策略优化的硬约束的现有方法不同,我们将示范数据作为建议,以状态和动作的生成模型所训练的奖励塑造势函数形式加以纳入。具体而言,我们考察了归一化流与生成对抗网络(GAN)来表示这些势函数。我们表明,与许多将示范作为硬约束的现有方法不同,即便在次优且有噪声的示范下,我们的方法也是无偏的。我们给出了大量仿真以及 Franka Emika 7DOF 机械臂上的实验,以证明我们方法的实用性。
引用
@article{arxiv.2011.01298,
title = {Shaping Rewards for Reinforcement Learning with Imperfect Demonstrations using Generative Models},
author = {Yuchen Wu and Melissa Mozifian and Florian Shkurti},
journal= {arXiv preprint arXiv:2011.01298},
year = {2020}
}
备注
submitted to ICRA 2021