中文

参数化动作空间中的混合Actor-Critic强化学习

机器学习 2019-05-31 v3 人工智能 机器学习

摘要

本文提出一种用于参数化动作空间强化学习的 actor-critic 混合架构,其由多个并行子 actor 网络组成,将结构化动作空间分解为更简单的动作空间,并配以一个 critic 网络来指导所有子 actor 网络的训练。尽管本文主要关注参数化动作空间,所提出的架构(我们称之为混合 actor-critic)可推广至具有层次结构的更一般动作空间。我们给出了基于近端策略优化(PPO)的混合 actor-critic 架构实例,称之为混合近端策略优化(H-PPO)。我们的实验在一系列具有参数化动作空间的任务上测试 H-PPO,结果表明 H-PPO 优于以往的参数化动作强化学习方法。

关键词

引用

@article{arxiv.1903.01344,
  title  = {Hybrid Actor-Critic Reinforcement Learning in Parameterized Action Space},
  author = {Zhou Fan and Rui Su and Weinan Zhang and Yong Yu},
  journal= {arXiv preprint arXiv:1903.01344},
  year   = {2019}
}