中文

利用符号启发式通过强化学习合成领域特定时序规划引导

人工智能 2025-05-20 v1

摘要

近期研究探讨了利用强化学习(RL)合成启发式引导以提升时序规划器性能的方法,适用于领域固定且给定一组训练问题(而非规划方案)的场景。其核心思想是从覆盖训练问题的特定(可能为无限状态)MDP 的价值函数中提取启发式。本文提出该学习与规划框架的演进版本,重点利用符号启发式在强化学习和规划两个阶段提供的信息。首先,我们形式化了合成过程中的不同奖励模式,并利用符号启发式缓解因处理潜在无限 MDP 而截断片段所带来的问题。其次,我们提出学习已有符号启发式的残差,即对启发式值的"修正",而非从头急切地学习整个启发式。最后,我们将学习到的启发式与符号启发式结合,采用多队列规划方法以平衡系统性搜索与不完美的学习信息。我们对所有方法进行了实验比较,突出了各自的优势与劣势,显著推进了该规划与学习范式的最新水平。

关键词

引用

@article{arxiv.2505.13372,
  title  = {Exploiting Symbolic Heuristics for the Synthesis of Domain-Specific Temporal Planning Guidance using Reinforcement Learning},
  author = {Irene Brugnara and Alessandro Valentini and Andrea Micheli},
  journal= {arXiv preprint arXiv:2505.13372},
  year   = {2025}
}