中文

基于多样性正则化协作探索的非局部策略优化

机器学习 2020-06-16 v1 机器学习

摘要

传统的强化学习(RL)算法通常让单个智能体独立学习解决任务。因此,该智能体只能探索状态-动作空间的有限部分,而学习到的行为与智能体先前的经验高度相关,这使得训练容易陷入局部最优。在这项工作中,我们赋予强化学习团队协作的能力,并提出了一种新颖的非局部策略优化框架,称为多样性正则化协作探索(DiCE)。DiCE 利用一组异构智能体同时探索环境并共享收集到的经验。我们进一步设计了一种正则化机制来维持团队的多样性并调节探索。我们在同策略和异策略设置下实现了该框架,实验结果表明,DiCE 在 MuJoCo 运动任务上相比基线方法取得了显著提升。

关键词

引用

@article{arxiv.2006.07781,
  title  = {Non-local Policy Optimization via Diversity-regularized Collaborative Exploration},
  author = {Zhenghao Peng and Hao Sun and Bolei Zhou},
  journal= {arXiv preprint arXiv:2006.07781},
  year   = {2020}
}

备注

https://decisionforce.github.io/DiCE/