中文

CRISP:用于分层强化学习的课程驱动原语感知子目标预测

机器学习 2025-08-19 v6

摘要

分层强化学习(HRL)利用时间抽象来高效处理复杂的长时序任务。然而,HRL 常因低层原语的持续更新使高层策略先前发出的子目标失效而崩溃,引入的非平稳性破坏了训练稳定性。我们提出 CRISP,一种以课程驱动的框架,通过三个关键要素解决该不稳定性:(1)原语感知解析(PIP),自适应地重新标注少量专家演示,始终由当前低层原语生成可达子目标;(2)逆强化学习正则化器,将高层策略导向专家诱导的子目标分布并稳定学习;(3)统一训练循环,利用这些组件提升样本效率。在六个稀疏奖励的机器人导航与操作基准上,CRISP 相比强分层与扁平基线将成功率提升逾 40%,并成功迁移至真实世界任务,展示了基于课程的分层强化学习在实际场景中的前景。

关键词

引用

@article{arxiv.2304.03535,
  title  = {CRISP: Curriculum Inducing Primitive Informed Subgoal Prediction for Hierarchical Reinforcement Learning},
  author = {Utsav Singh and Vinay P. Namboodiri},
  journal= {arXiv preprint arXiv:2304.03535},
  year   = {2025}
}