中文

基于模型展开的分层强化学习中引导式协作

机器学习 2024-04-09 v2 人工智能

摘要

目标条件分层强化学习(HRL)通过时间抽象为复杂、长程强化学习(RL)任务中的有效探索提供了一种有前景的方法。经验上,增强的层间通信与协调能够在分层系统中诱导出更稳定和鲁棒的策略改进。然而,大多数现有的目标条件 HRL 算法主要聚焦于子目标发现,忽视了层间合作。在此,我们提出一个名为基于模型展开的引导式协作(GCMR)的目标条件 HRL 框架,旨在通过利用前向动力学来弥合层间信息同步与协作。首先,GCMR 通过基于模型的展开减轻了离策略校正中的状态转移误差,从而提升了样本效率。其次,为防止未见子目标与状态的干扰,使用带有模型推断上界的梯度惩罚来约束低层 Q 函数梯度,从而得到更利于有效探索的稳定行为策略。第三,我们提出一种基于单步展开的计划,利用高层评论家引导低层策略。具体而言,我们使用高层评论家函数估计低层策略未来状态的价值,从而将全局任务信息向下传递以避免局部陷阱。GCMR 中的这三个关键组件有望显著促进层间合作。实验结果表明,将所提 GCMR 框架与 HIGL 的一个解耦变体(即 ACLG)结合,相较于多种基线可产生更稳定和鲁棒的策略改进,并显著优于先前的最先进算法。

关键词

引用

@article{arxiv.2309.13508,
  title  = {Guided Cooperation in Hierarchical Reinforcement Learning via Model-based Rollout},
  author = {Haoran Wang and Zeshen Tang and Leya Yang and Yaoru Sun and Fang Wang and Siyu Zhang and Yeming Chen},
  journal= {arXiv preprint arXiv:2309.13508},
  year   = {2024}
}

备注

Resubmit a revised version, in which we provided more illustrative examples, corrected the writing errors, and added references