中文

用于连续控制强化学习的吸引-排斥Actor-Critic

机器学习 2020-07-10 v3 人工智能 多智能体系统 机器学习

摘要

强化学习中的连续控制任务十分重要,因为它们为在高维状态空间中学习且具有欺骗性奖励的问题提供了一个重要框架,其中智能体很容易陷入次优解。避免局部最优的一种方法是使用智能体种群以确保策略空间的覆盖,然而学习一个具有“最佳”覆盖的种群仍是一个开放问题。在本工作中,我们提出了一种基于种群的连续控制 RL 新方法,其利用归一化流(normalizing flows)的性质在当前种群成员与先前观测到的策略之间执行吸引和排斥操作。在 MuJoCo 套件上的实证结果表明,与包括 Soft-Actor Critic(SAC)在内的先前工作相比,我们的算法获得了较高的性能提升。

关键词

引用

@article{arxiv.1909.07543,
  title  = {Attraction-Repulsion Actor-Critic for Continuous Control Reinforcement Learning},
  author = {Thang Doan and Bogdan Mazoure and Moloud Abdar and Audrey Durand and Joelle Pineau and R Devon Hjelm},
  journal= {arXiv preprint arXiv:1909.07543},
  year   = {2020}
}