中文

面向OpenAI Gym的MDP环境

机器学习 2017-09-27 v1

摘要

OpenAI Gym为研究人员和爱好者提供了易于使用的强化学习环境。即使是最简单的环境也具有一定程度的复杂性,这可能会掩盖强化学习方法的内部工作原理并使调试变得困难。本白皮书描述了一个Python框架,该框架通过在Python中使用领域特定语言指定确定性和非确定性马尔可夫决策过程(MDP)的状态转移和奖励,使得以编程方式创建简单的MDP环境变得非常容易。随后展示了使用该MDP框架创建的结果和可视化。

关键词

引用

@article{arxiv.1709.09069,
  title  = {MDP environments for the OpenAI Gym},
  author = {Andreas Kirsch},
  journal= {arXiv preprint arXiv:1709.09069},
  year   = {2017}
}

备注

6 pages, 2 figures