中文

基于分层强化学习与地标点的解谜 Sokoban

人工智能 2025-04-08 v1

摘要

我们引入一种新型的分层强化学习 (HRL) 框架,通过学习的子目标执行自上而下递归规划,成功应用于复杂的组合 puzzle 游戏 Sokoban。我们的框架构建了一个六层策略层级,其中高层策略为下层策略生成子目标。所有子目标和策略均从零开始端到端学习,无需任何领域知识。我们的结果表明,智能体可以从单次高层调用中生成长序列动作。虽然先前的工作探索了 2-3 层层级和基于子目标的规划启发式方法,但我们展示了纯粹通过学习可以实现深层递归目标分解,并且这些层级可以有效扩展到困难的 puzzle 领域。

关键词

引用

@article{arxiv.2504.04366,
  title  = {Solving Sokoban using Hierarchical Reinforcement Learning with Landmarks},
  author = {Sergey Pastukhov},
  journal= {arXiv preprint arXiv:2504.04366},
  year   = {2025}
}

备注

13 pages, 6 figures