强化学习中的上下文与时间挑战:引入 Space Fortress 作为基准
机器学习
2018-09-10 v1 人工智能
机器学习
摘要
深度强化学习(RL)研究已围绕提升如 Arcade Learning Environment 等基准上的性能而汇聚。然而,这些基准明显缺失了现实领域常出现的重要特征,如策略的突发性上下文相关转变与时间敏感性。因此,RL 研究未聚焦于这些挑战,导致算法无法理解上下文的关键变化,且对真实世界时间几乎无概念。为解决此问题,本文引入 Space Fortress 游戏作为包含这些特征的 RL 基准。我们表明现有最先进的 RL 算法无法学会游玩 Space Fortress 游戏。随后我们确认此糟糕性能源于 RL 算法的上下文不敏感与奖励稀疏。我们还确定了可独立变化上下文与时间敏感性的轴,使 Space Fortress 可用作联合及孤立理解这两种特征的试验台。我们将 Space Fortress 作为开源 Gym 环境发布。
引用
@article{arxiv.1809.02206,
title = {Challenges of Context and Time in Reinforcement Learning: Introducing Space Fortress as a Benchmark},
author = {Akshat Agarwal and Ryan Hope and Katia Sycara},
journal= {arXiv preprint arXiv:1809.02206},
year = {2018}
}
备注
8 pages. Code available at https://github.com/agakshat/spacefortress .Supersedes arXiv:1805.06824