中文

MDP Playground:一种用于强化学习的分析与调试测试平台

机器学习 2023-07-18 v5 人工智能 机器学习

摘要

我们提出 MDP Playground,一个面向强化学习(RL)智能体的测试平台,其具有可独立控制的难度维度,能以不同方式挑战智能体,并在玩具级与复杂 RL 环境中获得不同程度的难度。我们考虑并允许对多种维度进行控制,包括延迟奖励、序列长度、奖励密度、随机性、图像表示、无关特征、时间单位、动作范围等。我们通过在 OpenAI Gym 中改变这些维度定义了一组参数化的快速运行玩具环境,并提议利用这些环境更好地理解智能体。随后我们展示如何使用 MDP Playground 设计实验以洞察玩具环境。我们还提供可将众多此类维度注入任意 Gym 环境的封装器。我们在 Atari 和 Mujoco 上对这些封装器进行实验,以理解这些维度在比玩具环境更复杂的场景中的影响。我们还比较了这些维度在玩具与复杂环境中的效果。最后,我们展示了如何使用 MDP Playground 调试智能体、研究多维度交互,并描述了进一步用例。

关键词

引用

@article{arxiv.1909.07750,
  title  = {MDP Playground: An Analysis and Debug Testbed for Reinforcement Learning},
  author = {Raghu Rajan and Jessica Lizeth Borja Diaz and Suresh Guttikonda and Fabio Ferreira and André Biedenkapp and Jan Ole von Hartz and Frank Hutter},
  journal= {arXiv preprint arXiv:1909.07750},
  year   = {2023}
}

备注

Same version as the one published in JAIR Vol. 77 (2023)