面向OpenAI Gym的MDP环境
机器学习
2017-09-27 v1
摘要
OpenAI Gym为研究人员和爱好者提供了易于使用的强化学习环境。即使是最简单的环境也具有一定程度的复杂性,这可能会掩盖强化学习方法的内部工作原理并使调试变得困难。本白皮书描述了一个Python框架,该框架通过在Python中使用领域特定语言指定确定性和非确定性马尔可夫决策过程(MDP)的状态转移和奖励,使得以编程方式创建简单的MDP环境变得非常容易。随后展示了使用该MDP框架创建的结果和可视化。
引用
@article{arxiv.1709.09069,
title = {MDP environments for the OpenAI Gym},
author = {Andreas Kirsch},
journal= {arXiv preprint arXiv:1709.09069},
year = {2017}
}
备注
6 pages, 2 figures