基于后见之明的多层层次学习
人工智能
2019-09-05 v5 机器学习
神经与进化计算
机器人学
摘要
层次智能体有潜力以比非层次对应物更高的样本效率解决序列决策任务,因为层次智能体可将任务分解为仅需短决策序列的子任务集合。为实现这种更快学习的潜力,层次智能体需要能够并行学习其多个层级的策略,以便这些更简单的子问题可同时求解。然而,并行学习多个层级策略是困难的,因为它本质上不稳定:层次中某一层策略的改变可能导致更高层转移和奖励函数的变化,使联合学习多层策略变得困难。本文引入一种新的分层强化学习(HRL)框架——分层 Actor-Critic(HAC),可克服智能体尝试联合学习多层策略时出现的不稳定性问题。HAC 背后的主要思想是通过将每一层训练为仿佛下层策略已最优,从而独立于下层训练层次中的每一层。我们在网格世界和模拟机器人领域中通过实验证明,相对于其他非层次和层次方法,我们的方法能显著加速学习。事实上,我们的框架是首个在具有连续状态和动作空间的任务中成功并行学习三层层次的框架。
引用
@article{arxiv.1712.00948,
title = {Learning Multi-Level Hierarchies with Hindsight},
author = {Andrew Levy and George Konidaris and Robert Platt and Kate Saenko},
journal= {arXiv preprint arXiv:1712.00948},
year = {2019}
}
备注
ICLR 2019 Accepted Paper