中文

Critic PI2:通过路径积分策略改进与深度 Actor-Critic 强化学习掌握连续规划

机器学习 2020-11-16 v1 神经与进化计算 机器人学

摘要

构建具备规划能力的智能体一直是追求人工智能过程中的主要挑战之一。从 AlphaGo 到 Muzero 的基于树的规划方法在象棋和围棋等离散领域取得了巨大成功。遗憾的是,在动作空间通常为连续的倒立摆和机器人控制等实际应用中,那些基于树的规划技术举步维艰。为应对这些局限,本文提出一种称为 Critic PI2 的基于模型的强化学习新框架,它结合了轨迹优化、深度 actor-critic 学习与基于模型的强化学习的优势。我们的方法在倒立摆模型上进行了评估,并可应用于许多连续控制系统。大量实验表明,Critic PI2 在一系列具有挑战性的连续领域中达到了新的 state of the art(SOTA)。此外,我们展示了利用 critic 进行规划显著提升了样本效率与实时性能。我们的工作为学习基于模型的规划系统的组成模块及其使用方式开辟了新方向。

关键词

引用

@article{arxiv.2011.06752,
  title  = {Critic PI2: Master Continuous Planning via Policy Improvement with Path Integrals and Deep Actor-Critic Reinforcement Learning},
  author = {Jiajun Fan and He Ba and Xian Guo and Jianye Hao},
  journal= {arXiv preprint arXiv:2011.06752},
  year   = {2020}
}