中文

层次化零样子强化学习的切换后继措施

机器学习 2026-05-14 v1

摘要

层次化强化学习通过将长期决策分解为更简单的子问题来提高泛化能力。然而,现有方法常依赖限制性设计选择,如固定的时间抽象或目标条件目标,主要将其局限于目标到达任务,限制了其针对一般奖励函数的适用性。在本文中,我们引入切换后继措施(switching successor measures),这是一种后继措施的扩展,使其能够在无需额外监督、固定时间范围或手动设计子目标的情况下实现层次控制。我们表明,切换后继措施自然地从经典后继措施中产生,同时保持其 underlying 结构。基于此结果,我们提出了从前向-后向(FB)表示中提取高层子目标选择策略和低层控制策略的FB π\pi-Switch算法,使层次行为从单一学习表示中自然涌现。在针对目标条件和一般奖励-based任务的实验中,我们发现FB π\pi-Switch在非层次基准上取得改进,在目标条件 setting中与最先进的层次方法持平。这些结果表明,结构化后继表示为超越目标到达任务的层次化零样子强化学习提供了灵活的基础。我们的项目网站可在 https://stestokth.github.io/switching-successors/ 访问。

关键词

引用

@article{arxiv.2605.13207,
  title  = {Switching Successor Measures for Hierarchical Zero-shot Reinforcement Learning},
  author = {Stefan Stojanovic and Alexandre Proutiere},
  journal= {arXiv preprint arXiv:2605.13207},
  year   = {2026}
}