基于状态特定平衡系数的路标引导主动探索
机器学习
2024-04-18 v2
摘要
目标条件分层强化学习(GCHRL)通过分层框架将长时程任务分解为子任务,并在多个领域展现出有前景的结果。然而,高层策略的动作空间往往过大,对有效探索提出重大挑战并导致训练效率低下。在本文中,我们基于目标条件值函数在目标空间中进行规划,设计了一种子目标前景度量。在该前景度量基础上,我们提出一种路标引导探索策略,通过整合前景与新奇性度量来引导智能体高效探索并提升样本效率。为动态考虑前景与新奇性对探索的影响,我们引入状态特定平衡系数以平衡前景与新奇性的重要性。实验结果表明,我们所提出的探索策略在多个任务上显著优于基线方法。
引用
@article{arxiv.2306.17484,
title = {Landmark Guided Active Exploration with State-specific Balance Coefficient},
author = {Fei Cui and Jiaojiao Fang and Mengke Yang and Guizhong Liu},
journal= {arXiv preprint arXiv:2306.17484},
year = {2024}
}