中文

PEAR:用于提升分层强化学习的基元赋能自适应重标记方法

机器学习 2025-02-11 v6

摘要

分层强化学习(HRL)有望利用时间抽象与增强的探索来解决复杂的长时序任务。然而,由于固有的非平稳性,分层智能体难以训练。我们提出基元赋能自适应重标记(PEAR),一种两阶段方法:首先对少量专家示范进行自适应重标记以生成高效子目标监督,随后通过结合强化学习(RL)与模仿学习(IL)联合优化HRL智能体。我们进行理论分析以界定本方法的次优性上界,并推导出使用RL与IL的联合优化框架。由于PEAR仅利用少量专家示范且对任务结构作极少的限制性假设,它可轻易与典型的离策略RL算法集成,从而产生一种实用的HRL方法。我们在具挑战性的环境中进行了大量实验,表明PEAR能够超越多种分层与非分层基线,并在其他基线通常难以取得显著进展的复杂稀疏机器人控制任务中达到高达80%80\%的成功率。我们还进行消融实验以透彻分析各项设计选择的重要性。最后,我们在复杂任务上进行了真实世界机器人实验,证明PEAR持续优于基线。

关键词

引用

@article{arxiv.2306.06394,
  title  = {PEAR: Primitive Enabled Adaptive Relabeling for Boosting Hierarchical Reinforcement Learning},
  author = {Utsav Singh and Vinay P. Namboodiri},
  journal= {arXiv preprint arXiv:2306.06394},
  year   = {2025}
}