基于高斯过程的概率子目标表示用于分层强化学习
机器学习
2024-06-25 v1 人工智能
摘要
在以目标为导向的分层强化学习中,高层策略指定一个子目标供低层策略达到。有效的分层强化学习取决于合适的子目标表示函数,该函数将状态空间抽象为潜在子目标空间,并诱导出不同的低层行为。现有方法采用确定性的子目标表示,将状态空间映射到潜在子目标空间。相反,本文首次利用高斯过程(GP)构建概率化的子目标表示。该方法在潜在子目标空间上引入GP先验,学习子目标表示函数的后验分布,同时通过可学习的核函数利用状态空间中的长程关联。这使得能够构建一个能够整合先前规划步骤中长程子目标信息的自适应记忆,从而应对随机不确定性。此外,本文提出了一种新颖的学习目标,以在统一框架内同时学习概率化子目标表示和策略。在实验中,我们的方法在标准基准测试中超越了最先进的基线方法,也在具有随机元素且在多样化奖励条件下的环境中表现出色。此外,该模型在不同任务之间传递低层策略方面显示出有前景的能力。
引用
@article{arxiv.2406.16707,
title = {Probabilistic Subgoal Representations for Hierarchical Reinforcement learning},
author = {Vivienne Huiling Wang and Tinghuai Wang and Wenyan Yang and Joni-Kristian Kämäräinen and Joni Pajarinen},
journal= {arXiv preprint arXiv:2406.16707},
year = {2024}
}