中文

用于分层强化学习的 FeUdal Networks

人工智能 2017-03-07 v2

摘要

我们引入了 FeUdal Networks (FuNs):一种用于分层强化学习的新颖架构。我们的方法受 Dayan 和 Hinton 的封建强化学习提案启发,通过解耦跨多个层级的端到端学习获得力量与效能——使其能够利用不同的时间分辨率。我们的框架采用一个 Manager 模块和一个 Worker 模块。Manager 在较低的时间分辨率上运行,并设定抽象目标,这些目标传达给 Worker 并由其执行。Worker 在环境的每个时间步生成原始动作。FuN 的解耦结构带来了若干益处——除了促进极长时间尺度的信用分配外,它还鼓励与 Manager 设定的不同目标相关的子策略的出现。这些特性使得 FuN 在涉及长期信用分配或记忆的任务上显著优于强大的基线智能体。我们在 ATARI 套件的一系列任务以及 3D DeepMind Lab 环境中展示了所提系统的性能。

关键词

引用

@article{arxiv.1703.01161,
  title  = {FeUdal Networks for Hierarchical Reinforcement Learning},
  author = {Alexander Sasha Vezhnevets and Simon Osindero and Tom Schaul and Nicolas Heess and Max Jaderberg and David Silver and Koray Kavukcuoglu},
  journal= {arXiv preprint arXiv:1703.01161},
  year   = {2017}
}