中文

集成中的离策略 Actor-Critic:在深度强化学习中实现最大广义熵与有效的环境探索

机器学习 2019-02-18 v1 机器学习

摘要

我们提出一种新的策略迭代理论,作为软策略迭代与 Soft Actor-Critic (SAC) 的重要扩展,SAC 是深度强化学习中最高效的免模型算法之一。在该新理论支持下,可运用推广香农熵的任意熵度量(如 Tsallis 熵与 Renyi 熵)来适当随机化动作选择,同时实现最大化期望长期回报的目标。我们的理论催生了两种新算法,即 Tsallis 熵 Actor-Critic (TAC) 与 Renyi 熵 Actor-Critic (RAC)。理论分析表明这些算法可比 SAC 更有效。此外,它们为我们在此开发一种新的集成 Actor-Critic (EAC) 算法铺平了道路,该算法特点在于使用自举机制进行深度环境探索,以及基于新价值函数的机制进行高层动作选择。经验上我们表明,TAC、RAC 与 EAC 在一系列基准控制任务上可达到最先进性能,在样本效率与有效性方面均优于 SAC 及若干前沿学习算法。

关键词

引用

@article{arxiv.1902.05551,
  title  = {Off-Policy Actor-Critic in an Ensemble: Achieving Maximum General Entropy and Effective Environment Exploration in Deep Reinforcement Learning},
  author = {Gang Chen and Yiming Peng},
  journal= {arXiv preprint arXiv:1902.05551},
  year   = {2019}
}