中文

基于状态特定平衡系数的路标引导主动探索

机器学习 2024-04-18 v2

摘要

目标条件分层强化学习(GCHRL)通过分层框架将长时程任务分解为子任务,并在多个领域展现出有前景的结果。然而,高层策略的动作空间往往过大,对有效探索提出重大挑战并导致训练效率低下。在本文中,我们基于目标条件值函数在目标空间中进行规划,设计了一种子目标前景度量。在该前景度量基础上,我们提出一种路标引导探索策略,通过整合前景与新奇性度量来引导智能体高效探索并提升样本效率。为动态考虑前景与新奇性对探索的影响,我们引入状态特定平衡系数以平衡前景与新奇性的重要性。实验结果表明,我们所提出的探索策略在多个任务上显著优于基线方法。

关键词

引用

@article{arxiv.2306.17484,
  title  = {Landmark Guided Active Exploration with State-specific Balance Coefficient},
  author = {Fei Cui and Jiaojiao Fang and Mengke Yang and Guizhong Liu},
  journal= {arXiv preprint arXiv:2306.17484},
  year   = {2024}
}