中文

基于潜在地标图的分层强化学习中探索与利用的平衡

机器学习 2023-07-25 v1

摘要

目标条件分层强化学习(GCHRL)是解决强化学习中探索-利用困境的一种有前景的范式。它将源任务分解为子目标条件子任务,并在子目标空间中进行探索与利用。GCHRL的有效性严重依赖于子目标表示函数和子目标选择策略。然而,现有工作在学习潜在子目标表示时常常忽视GCHRL中的时间连贯性,并且缺乏一种能够平衡探索与利用的高效子目标选择策略。本文提出通过动态构建潜在地标图的分层强化学习(HILL)来克服这些局限。HILL使用对比表示学习目标来学习满足时间连贯性的潜在子目标表示。基于这些表示,HILL动态构建潜在地标图,并对节点采用新颖性度量、对边采用效用度量。最后,HILL开发了一种通过联合考虑两种度量来平衡探索与利用的子目标选择策略。实验结果表明,在稀疏奖励的连续控制任务中,HILL在样本效率和渐近性能上优于最先进的基线方法。我们的代码可在 https://github.com/papercode2022/HILL 获取。

关键词

引用

@article{arxiv.2307.12063,
  title  = {Balancing Exploration and Exploitation in Hierarchical Reinforcement Learning via Latent Landmark Graphs},
  author = {Qingyang Zhang and Yiming Yang and Jingqing Ruan and Xuantang Xiong and Dengpeng Xing and Bo Xu},
  journal= {arXiv preprint arXiv:2307.12063},
  year   = {2023}
}

备注

Accepted by the conference of International Joint Conference on Neural Networks (IJCNN) 2023