中文

行为引导的Actor-Critic:通过策略行为表示学习改进深度强化学习的探索

机器学习 2021-04-12 v1 人工智能

摘要

本文提出行为引导的Actor-Critic(BAC),一种离策略actor-critic深度强化学习算法。BAC通过自编码器对策略的行为进行数学建模,准确估计每个状态-动作对被访问的频率,同时考虑在决定策略所产生轨迹中起关键作用的状态动力学。智能体被鼓励在通过最大化期望折扣奖励和以获得良好性能的同时,持续将其行为转向较少访问的状态-动作对,从而实现对环境的高效探索并对所有高奖励区域良好利用。我们方法的一个显著特点是,与最大熵深度强化学习算法不同,它适用于随机与确定性actor。结果表明,与若干前沿学习算法相比,BAC性能明显更优。

关键词

引用

@article{arxiv.2104.04424,
  title  = {Behavior-Guided Actor-Critic: Improving Exploration via Learning Policy Behavior Representation for Deep Reinforcement Learning},
  author = {Ammar Fayad and Majd Ibrahim},
  journal= {arXiv preprint arXiv:2104.04424},
  year   = {2021}
}

备注

Preprint. Under Review. 9 pages, 3 figures, 1 table