中文

贪婪 Actor-Critic:一种用于策略改进的新条件交叉熵方法

机器学习 2023-03-02 v4 人工智能 机器学习

摘要

许多策略梯度方法是 Actor-Critic(AC)的变体,其中学习一个值函数(评论家)以辅助更新参数化策略(行动者)。对行动者的更新涉及由动作值加权的对数似然更新,并对软变体加入熵正则化。在本工作中,我们探索一种基于交叉熵方法(CEM)对输入(状态)条件化扩展的行动者替代更新。其思想是从一个较宽泛的策略出发,并围绕最大动作缓慢集中,使用对每个状态下位于前百分位数动作的最大似然更新。该集中速度由一个提议策略控制,其集中速率慢于行动者。我们首先在理想化设定下给出策略改进结果,然后证明我们的条件 CEM(CCEM)策略即使面对变化的动作值也跟踪每个状态上的 CEM 更新。我们通过实验表明,使用 CCEM 进行行动者更新的贪婪 AC 算法优于 Soft Actor-Critic,且对熵正则化敏感得多低。

关键词

引用

@article{arxiv.1810.09103,
  title  = {Greedy Actor-Critic: A New Conditional Cross-Entropy Method for Policy Improvement},
  author = {Samuel Neumann and Sungsu Lim and Ajin Joseph and Yangchen Pan and Adam White and Martha White},
  journal= {arXiv preprint arXiv:1810.09103},
  year   = {2023}
}

备注

27 pages, 8 figures