Escape Room:一种可配置的分层强化学习测试平台
人工智能
2018-12-27 v1
摘要
强化学习近期的成功鼓舞了快速增长的 RL 研究者网络与若干 RL 研究突破。随着 RL 社群与 RL 工作体的扩大,对能公平有效评估各类 RL 算法的广泛适用基准的需求也与日俱增。这一需求在分层强化学习(HRL)领域尤为明显。尽管许多现有测试域可能展现分层动作或状态结构,现代 RL 算法在求解需分层建模与动作规划的域时仍极感困难,即便这些域看似平凡。这些困难既凸显了对 HRL 算法本身更多关注的必要,也凸显了对能激励并验证 HRL 研究的新型测试平台的必要。现有 HRL 测试平台存在金发姑娘问题:它们往往过于简单(如 Taxi)或过于复杂(如街机学习环境中的 Montezuma's Revenge)。本文提出 Escape Room 域(ERD),一种新颖灵活、可扩展且完整实现、填补现有方案遗留“中等复杂度”空白的 HRL 测试域。ERD 开源并可通过 GitHub 免费获取,且遵循广泛使用的公共测试接口,以便与多种公共 RL 智能体实现简单集成与测试。我们展示 ERD 提供一套难度可扩展的挑战,从而提供从 Taxi 到街机学习环境的平滑学习梯度。
引用
@article{arxiv.1812.09521,
title = {Escape Room: A Configurable Testbed for Hierarchical Reinforcement Learning},
author = {Jacob Menashe and Peter Stone},
journal= {arXiv preprint arXiv:1812.09521},
year = {2018}
}
备注
24 pages, 4 image figures