均值行动者-评论家
机器学习
2018-05-24 v2 人工智能
机器学习
摘要
我们提出了一种用于离散动作连续状态强化学习的新算法——均值行动者-评论家(Mean Actor-Critic, MAC)。MAC是一种策略梯度算法,它利用智能体对所有动作价值的显式表示来估计策略梯度,而非仅使用实际执行的动作。我们证明,与传统行动者-评论家方法相比,该方法降低了策略梯度估计的方差。我们在两个控制领域和六款Atari游戏上展示了实证结果,其中MAC与最先进的策略搜索算法具有竞争力。
引用
@article{arxiv.1709.00503,
title = {Mean Actor Critic},
author = {Cameron Allen and Kavosh Asadi and Melrose Roderick and Abdel-rahman Mohamed and George Konidaris and Michael Littman},
journal= {arXiv preprint arXiv:1709.00503},
year = {2018}
}