中文

面向多维动作空间策略梯度的有效熵方法

机器学习 2018-06-05 v1 人工智能 系统与控制 机器学习

摘要

近年来,深度强化学习已被证明擅长解决具有高维状态空间的序列决策过程,例如在 Atari 游戏中。然而,许多强化学习问题涉及高维离散动作空间以及高维状态空间。本文考虑在策略梯度中用于鼓励探索的熵奖励。在高维动作空间的情况下,计算熵及其梯度需要枚举动作空间中的所有动作,并对每个动作运行前向和反向传播,这在计算上可能是不可行的。我们为熵奖励及其梯度开发了几种新颖的无偏估计器。我们将这些估计器应用于参数化策略的若干模型,包括独立采样、CommNet、基于修正 MDP 的自回归以及基于 LSTM 的自回归。最后,我们在两个环境中测试了我们的算法:多猎人多兔子网格游戏和多智能体多臂赌博机问题。结果表明,我们的熵估计器以微小的额外计算成本大幅提升了性能。

关键词

引用

@article{arxiv.1806.00589,
  title  = {Efficient Entropy for Policy Gradient with Multidimensional Action Space},
  author = {Yiming Zhang and Quan Ho Vuong and Kenny Song and Xiao-Yue Gong and Keith W. Ross},
  journal= {arXiv preprint arXiv:1806.00589},
  year   = {2018}
}