中文

面向进化强化学习的招募-模仿机制

机器学习 2019-12-16 v1 人工智能 神经与进化计算

摘要

强化学习、进化算法和模仿学习是处理连续控制任务的三种主要方法。强化学习样本效率高,但对超参数设置敏感且需要高效探索;进化算法稳定,但样本效率低;模仿学习既样本高效又稳定,然而它需要专家数据的指导。在本文中,我们提出面向进化强化学习的招募-模仿机制(RIM),这是一个结合了上述三种方法优势的可扩展框架。该框架的核心是一个双演员单评论家的强化学习智能体。该智能体可以从进化算法的种群中招募高适应度演员,指导其从经验回放缓冲区中学习。同时,进化种群中低适应度的演员可以模仿强化学习智能体的行为模式并提高其适应性。该框架中的强化与模仿学习者可被任何离策略演员-评论家强化学习器或数据驱动的模仿学习器替代。我们在Mujoco的一系列连续控制任务基准上评估了RIM。实验结果表明,RIM优于先前的进化或强化学习方法。RIM各组件的性能显著优于先前进化强化学习算法的组件,且使用软更新的招募使强化学习智能体比使用硬更新的学习更快。

关键词

引用

@article{arxiv.1912.06310,
  title  = {Recruitment-imitation Mechanism for Evolutionary Reinforcement Learning},
  author = {Shuai Lü and Shuai Han and Wenbo Zhou and Junwei Zhang},
  journal= {arXiv preprint arXiv:1912.06310},
  year   = {2019}
}