中文

通过激励合理新颖状态促进 actor-critic 算法的探索

机器学习 2022-10-04 v1 系统与控制 系统与控制

摘要

Actor-critic(AC)算法是一类无模型深度强化学习算法,已在多个领域证明其有效性,尤其在求解连续控制问题中。利用更高效样本改善探索(动作熵)与利用(期望回报)是 AC 算法中的关键问题。学习算法的一种基本策略是便利无差别地探索全部环境状态空间,以及鼓励探索罕见访问状态而非频繁访问状态。在此策略下,我们提出一种通过内在奖励促进探索的新方法,该方法基于对状态新颖性及其探索所带来的相关收益(就策略优化而言)的度量,统称为合理新颖性。通过对合理新颖状态探索的激励,AC 算法能够提升其样本效率从而改善训练表现。新方法通过在 MuJoCo 环境的连续控制任务上针对多种著名离策略 AC 算法进行大量仿真得到验证。

关键词

引用

@article{arxiv.2210.00211,
  title  = {Boosting Exploration in Actor-Critic Algorithms by Incentivizing Plausible Novel States},
  author = {Chayan Banerjee and Zhiyong Chen and Nasimul Noman},
  journal= {arXiv preprint arXiv:2210.00211},
  year   = {2022}
}