中文

基于动作值评论家的离散动作同策略学习

机器学习 2020-02-24 v2 机器学习

摘要

离散动作空间中的强化学习(RL)在真实世界应用中无处不在,但其复杂度随动作空间维度呈指数增长,使得高效应用现有的基于同策略梯度的深度 RL 算法具有挑战性。为在多维离散动作空间中有效运作,我们构建了一个评论家(critic)来估计动作值函数,将其应用于相关动作,并组合这些评论家估计的动作值以控制梯度估计的方差。我们遵循严格的统计分析来设计如何生成和组合这些相关动作,以及如何通过关闭某些维度的贡献来稀疏化梯度。这些努力产生了一种新的离散动作同策略 RL 算法,在经验上优于依赖方差控制技术的相关同策略算法。我们在 OpenAI Gym 基准任务上展示了这些特性,并说明由于离散策略的灵活性,离散化动作空间如何有益于探索阶段,从而有助于收敛到更好的局部最优解。

关键词

引用

@article{arxiv.2002.03534,
  title  = {Discrete Action On-Policy Learning with Action-Value Critic},
  author = {Yuguang Yue and Yunhao Tang and Mingzhang Yin and Mingyuan Zhou},
  journal= {arXiv preprint arXiv:2002.03534},
  year   = {2020}
}