中文

人引导的机器人行为学习:一种GAN辅助的基于偏好的强化学习方法

机器人学 2020-10-16 v1 机器学习

摘要

人类示范可提供可信样本来训练强化学习算法,使机器人在真实环境中学习复杂行为。然而,获得充足示范可能不切实际,因为许多行为难以由人类示范。一种更实际的方法是以人类查询替代人类示范,即基于偏好的强化学习。现有算法的一个关键局限是需要大量人类查询,因为需要大量标注数据来训练神经网络以近似连续、高维奖励函数。为减少并最小化对人类查询的需求,我们提出一种新的GAN辅助人类偏好基于偏好的强化学习方法,该方法使用生成对抗网络(GAN)主动学习人类偏好,进而替代人类在分配偏好中的角色。该对抗神经网络简单且仅有二值输出,因此训练所需人类查询少得多。此外,设计了一种基于最大熵的强化学习算法,将损失塑形至期望区域或远离不期望区域。为展示所提方法的有效性,我们在典型MuJoCo机器人运动环境中给出了一些无环境奖励访问的复杂机器人任务研究。所得结果表明我们的方法可在不牺牲性能的情况下减少约99.8%的人类时间。

关键词

引用

@article{arxiv.2010.07467,
  title  = {Human-guided Robot Behavior Learning: A GAN-assisted Preference-based Reinforcement Learning Approach},
  author = {Huixin Zhan and Feng Tao and Yongcan Cao},
  journal= {arXiv preprint arXiv:2010.07467},
  year   = {2020}
}

备注

8 pages