用于分层强化学习的 FeUdal Networks
人工智能
2017-03-07 v2
摘要
我们引入了 FeUdal Networks (FuNs):一种用于分层强化学习的新颖架构。我们的方法受 Dayan 和 Hinton 的封建强化学习提案启发,通过解耦跨多个层级的端到端学习获得力量与效能——使其能够利用不同的时间分辨率。我们的框架采用一个 Manager 模块和一个 Worker 模块。Manager 在较低的时间分辨率上运行,并设定抽象目标,这些目标传达给 Worker 并由其执行。Worker 在环境的每个时间步生成原始动作。FuN 的解耦结构带来了若干益处——除了促进极长时间尺度的信用分配外,它还鼓励与 Manager 设定的不同目标相关的子策略的出现。这些特性使得 FuN 在涉及长期信用分配或记忆的任务上显著优于强大的基线智能体。我们在 ATARI 套件的一系列任务以及 3D DeepMind Lab 环境中展示了所提系统的性能。
引用
@article{arxiv.1703.01161,
title = {FeUdal Networks for Hierarchical Reinforcement Learning},
author = {Alexander Sasha Vezhnevets and Simon Osindero and Tom Schaul and Nicolas Heess and Max Jaderberg and David Silver and Koray Kavukcuoglu},
journal= {arXiv preprint arXiv:1703.01161},
year = {2017}
}