中文

面向连续控制的引导 Actor-Critic 方法

机器学习 2018-02-23 v2

摘要

Actor-Critic 方法通过沿增加期望回报估计(称为 Critic)的方向更新参数化策略(称为 Actor)来解决强化学习问题。然而,现有的 Actor-Critic 方法仅使用 Critic 的值或梯度来更新策略参数。本文提出一种新颖的 Actor-Critic 方法,称为引导 Actor-Critic (GAC)。GAC 首先学习一个局部最大化 Critic 的引导 Actor,然后通过监督学习基于该引导 Actor 更新策略参数。我们的主要理论贡献有两方面。第一,我们证明 GAC 通过在动作空间中执行二阶优化来更新引导 Actor,其中曲率矩阵基于 Critic 的 Hessian 矩阵。第二,我们证明确定性策略梯度方法是 GAC 在忽略 Hessian 矩阵时的一个特例。通过实验,我们表明所提方法是一种有前景的面向连续控制的强化学习方法。

关键词

引用

@article{arxiv.1705.07606,
  title  = {Guide Actor-Critic for Continuous Control},
  author = {Voot Tangkaratt and Abbas Abdolmaleki and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:1705.07606},
  year   = {2018}
}

备注

ICLR 2018