分层强化学习中近最优的表示学习
人工智能
2019-01-10 v2
摘要
我们研究目标条件分层强化学习中的表示学习问题。在此类分层结构中,高层控制器通过迭代传达目标来解决问题,低层策略被训练以达成这些目标。因此,表示的选择——即观测空间到目标空间的映射——至关重要。为研究该问题,我们提出了表示次优性的概念,其通过使用该表示的最优分层策略的期望奖励来定义。我们推导出界定次优性的表达式,并展示这些表达式如何转化为可在实践中优化的表示学习目标。在若干困难连续控制任务上的结果表明,与现有方法相比,我们的表示学习方法在定性上产生了更好的表示,在定量上产生了更好的分层策略(视频见 https://sites.google.com/view/representation-hrl)。
引用
@article{arxiv.1810.01257,
title = {Near-Optimal Representation Learning for Hierarchical Reinforcement Learning},
author = {Ofir Nachum and Shixiang Gu and Honglak Lee and Sergey Levine},
journal= {arXiv preprint arXiv:1810.01257},
year = {2019}
}
备注
ICLR 2019 Conference Paper