中文

规划形状对高维状态空间中 Dyna 式规划的影响

人工智能 2019-04-01 v3

摘要

Dyna 是基于模型的强化学习(MBRL)的一种基本方法,它在在线设置中交错进行规划、行动与学习。在 Dyna 最典型的应用中,动力学模型用于从智能体历史中选取的起始状态生成单步转移,这些转移被用于更新智能体的值函数或策略,如同它们是真实经验一样。在这项工作中,单步 Dyna 被应用于来自街机学习环境(ALE)的若干游戏。我们发现,即便使用完美模型,基于模型的更新相对于仅用智能体已有经验进行更多更新所带来的益处也出奇地小。我们假设,要从规划中获得最大收益,模型必须用于生成不熟悉的体验。为验证这一点,我们在 Dyna 的多种不同具体实现中实验了规划的“形状”,执行更少但更长的展开(rollout),而非许多短展开。我们发现规划形状对 Dyna 在完美模型与学习模型下的有效性均有深远影响。除了这些关于 Dyna 的总体发现外,我们的结果据我们所知首次在 ALE 中成功使用学习到的动力学模型进行规划,表明 Dyna 可能是 ALE 及其他高维问题中 MBRL 的一种可行方法。

关键词

引用

@article{arxiv.1806.01825,
  title  = {The Effect of Planning Shape on Dyna-style Planning in High-dimensional State Spaces},
  author = {G. Zacharias Holland and Erin J. Talvitie and Michael Bowling},
  journal= {arXiv preprint arXiv:1806.01825},
  year   = {2019}
}