中文

具有预期的强化学习:面向长期任务的层次化方法

机器学习 2025-09-09 v1

摘要

在强化学习(RL)中解决长期目标条件任务仍是一个重要挑战。层次化强化学习(HRL)通过将任务分解为更可管理的子任务来解决此问题,但自动发现层次结构以及多级策略的联合训练通常会遭遇不稳定问题且可能缺乏理论保证。本文引入具有预期的强化学习(RLA),是一个原则且可能可扩展的框架,用于解决这些限制。RLA代理学习两个协同的模型:一个低层、以目标为条件的策略,用于学习到达指定子目标,以及一个高层的预期模型,作为规划器,提出到达最终目标的最优路径上的中间子目标。RLA的关键特征是预期模型的训练,该模型受价值几何一致性原则指导,并经过正则化以防止出现退化解。我们给出了在各种条件下RLA接近全局最优策略的证明,建立了一种原则且收敛的方法,用于在长期目标条件任务中进行层次规划和执行。

关键词

引用

@article{arxiv.2509.05545,
  title  = {Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks},
  author = {Yang Yu},
  journal= {arXiv preprint arXiv:2509.05545},
  year   = {2025}
}