分层强化学习中的路标引导子目标生成
机器学习
2021-12-07 v3
摘要
目标条件分层强化学习(HRL)在解决复杂且长程RL任务中已展现出有前景的结果。然而,目标条件HRL中高层策略的动作空间通常很大,导致探索不佳,训练效率低下。本文提出HIGL(Landmark引导的分层强化学习,HIerarchical reinforcement learning Guided by Landmarks),一种以路标(即有探索价值的有前景状态)引导、缩小动作空间来训练高层策略的新框架。HIGL的关键组件有两方面:(a) 采样对探索具有信息量的路标;(b) 鼓励高层策略朝所选路标生成子目标。对于(a),我们考虑两个准则:整个已访问状态空间的覆盖(即状态的分散性)与状态的新颖性(即状态的预测误差)。对于(b),我们选取在节点为路标的图中最短路径上的第一个路标作为目标路标。我们的实验表明,得益于路标引导的高效探索,我们的框架在多种控制任务上优于先前最佳方法。
引用
@article{arxiv.2110.13625,
title = {Landmark-Guided Subgoal Generation in Hierarchical Reinforcement Learning},
author = {Junsu Kim and Younggyo Seo and Jinwoo Shin},
journal= {arXiv preprint arXiv:2110.13625},
year = {2021}
}
备注
Accepted to NeurIPS 2021