中文

均值行动者-评论家

机器学习 2018-05-24 v2 人工智能 机器学习

摘要

我们提出了一种用于离散动作连续状态强化学习的新算法——均值行动者-评论家(Mean Actor-Critic, MAC)。MAC是一种策略梯度算法,它利用智能体对所有动作价值的显式表示来估计策略梯度,而非仅使用实际执行的动作。我们证明,与传统行动者-评论家方法相比,该方法降低了策略梯度估计的方差。我们在两个控制领域和六款Atari游戏上展示了实证结果,其中MAC与最先进的策略搜索算法具有竞争力。

关键词

引用

@article{arxiv.1709.00503,
  title  = {Mean Actor Critic},
  author = {Cameron Allen and Kavosh Asadi and Melrose Roderick and Abdel-rahman Mohamed and George Konidaris and Michael Littman},
  journal= {arXiv preprint arXiv:1709.00503},
  year   = {2018}
}