中文

强化学习行为套件

机器学习 2020-02-17 v3 人工智能 机器学习

摘要

本文介绍了强化学习行为套件,简称 bsuite。bsuite 是一组精心设计的实验,用于研究强化学习(RL)智能体的核心能力,具有两个目标。首先,收集清晰、信息丰富且可扩展的问题,以捕捉通用高效学习算法设计中的关键问题。其次,通过这些共享基准上的表现来研究智能体行为。为补充这一工作,我们开源了 github.com/deepmind/bsuite,可对任意智能体在 bsuite 上的评估与分析实现自动化。该库促进了关于 RL 核心问题的可复现且可及的研究,并最终有助于更优学习算法的设计。我们的代码为 Python,且易于在现有项目中使用。我们包含了与 OpenAI Baselines、Dopamine 以及新的参考实现相关的示例。展望未来,我们希望纳入研究界更多优秀的实验,并承诺由一个杰出研究者委员会对 bsuite 进行定期评审。

关键词

引用

@article{arxiv.1908.03568,
  title  = {Behaviour Suite for Reinforcement Learning},
  author = {Ian Osband and Yotam Doron and Matteo Hessel and John Aslanides and Eren Sezener and Andre Saraiva and Katrina McKinney and Tor Lattimore and Csaba Szepesvari and Satinder Singh and Benjamin Van Roy and Richard Sutton and David Silver and Hado Van Hasselt},
  journal= {arXiv preprint arXiv:1908.03568},
  year   = {2020}
}