中文

基于策略的自竞争用于规划问题

机器学习 2023-06-08 v1

摘要

AlphaZero 类型的算法在单人任务上可能停止改进,原因在于引导树搜索的价值网络无法充分近似一局回合的结果。解决此问题的一种技术是通过自竞争来转换单人任务。其主要思想是依据智能体的历史表现计算一个标量基线,并将一局回合的奖励重塑为二元输出,指示是否超过了该基线。然而,该基线仅为智能体提供了关于如何改进策略的有限信息。我们利用自竞争的思想,直接将历史策略纳入规划过程,而非其标量表现。基于最近提出的 Gumbel AlphaZero (GAZ),我们提出了我们的算法 GAZ 'Play-to-Plan' (GAZ PTP),其中智能体通过对自身过去可能策略进行规划来学习寻找强轨迹。我们在两个著名的组合优化问题——旅行商问题 (Traveling Salesman Problem) 和作业车间调度问题 (Job-Shop Scheduling Problem) 中展示了我们方法的有效性。仅用一半的搜索模拟预算,GAZ PTP 始终优于所有选定的 GAZ 单人变体。

关键词

引用

@article{arxiv.2306.04403,
  title  = {Policy-Based Self-Competition for Planning Problems},
  author = {Jonathan Pirnay and Quirin Göttl and Jakob Burger and Dominik Gerhard Grimm},
  journal= {arXiv preprint arXiv:2306.04403},
  year   = {2023}
}

备注

24 pages, 5 figures