中文

SUNRISE:深度强化学习中集成学习的简单统一框架

机器学习 2021-06-15 v4 人工智能 机器学习

摘要

离策略深度强化学习(RL)已在一系列具有挑战性的领域中取得成功。然而,标准离策略 RL 算法可能面临若干问题,例如 Q-learning 的不稳定性以及探索与利用的平衡。为缓解这些问题,我们提出 SUNRISE,一种简单的统一集成方法,兼容多种离策略 RL 算法。SUNRISE 集成了两个关键要素:(a)基于集成的加权 Bellman 备份,其根据来自 Q-集成的不确定性估计对目标 Q 值重新加权;(b)一种推理方法,使用最高上置信界选择动作以实现高效探索。通过利用随机初始化 Bootstrap 强制智能体间的多样性,我们表明这些不同思想在很大程度上是正交的,并可有效整合,进一步提升现有离策略 RL 算法(如 Soft Actor-Critic 和 Rainbow DQN)在连续与离散控制任务以及低维与高维环境中的性能。我们的训练代码可在 https://github.com/pokaxpoka/sunrise 获取。

关键词

引用

@article{arxiv.2007.04938,
  title  = {SUNRISE: A Simple Unified Framework for Ensemble Learning in Deep Reinforcement Learning},
  author = {Kimin Lee and Michael Laskin and Aravind Srinivas and Pieter Abbeel},
  journal= {arXiv preprint arXiv:2007.04938},
  year   = {2021}
}

备注

ICML 2021 camera ready