行为引导的Actor-Critic:通过策略行为表示学习改进深度强化学习的探索
机器学习
2021-04-12 v1 人工智能
摘要
本文提出行为引导的Actor-Critic(BAC),一种离策略actor-critic深度强化学习算法。BAC通过自编码器对策略的行为进行数学建模,准确估计每个状态-动作对被访问的频率,同时考虑在决定策略所产生轨迹中起关键作用的状态动力学。智能体被鼓励在通过最大化期望折扣奖励和以获得良好性能的同时,持续将其行为转向较少访问的状态-动作对,从而实现对环境的高效探索并对所有高奖励区域良好利用。我们方法的一个显著特点是,与最大熵深度强化学习算法不同,它适用于随机与确定性actor。结果表明,与若干前沿学习算法相比,BAC性能明显更优。
引用
@article{arxiv.2104.04424,
title = {Behavior-Guided Actor-Critic: Improving Exploration via Learning Policy Behavior Representation for Deep Reinforcement Learning},
author = {Ammar Fayad and Majd Ibrahim},
journal= {arXiv preprint arXiv:2104.04424},
year = {2021}
}
备注
Preprint. Under Review. 9 pages, 3 figures, 1 table