基于策略的自竞争用于规划问题
机器学习
2023-06-08 v1
摘要
AlphaZero 类型的算法在单人任务上可能停止改进,原因在于引导树搜索的价值网络无法充分近似一局回合的结果。解决此问题的一种技术是通过自竞争来转换单人任务。其主要思想是依据智能体的历史表现计算一个标量基线,并将一局回合的奖励重塑为二元输出,指示是否超过了该基线。然而,该基线仅为智能体提供了关于如何改进策略的有限信息。我们利用自竞争的思想,直接将历史策略纳入规划过程,而非其标量表现。基于最近提出的 Gumbel AlphaZero (GAZ),我们提出了我们的算法 GAZ 'Play-to-Plan' (GAZ PTP),其中智能体通过对自身过去可能策略进行规划来学习寻找强轨迹。我们在两个著名的组合优化问题——旅行商问题 (Traveling Salesman Problem) 和作业车间调度问题 (Job-Shop Scheduling Problem) 中展示了我们方法的有效性。仅用一半的搜索模拟预算,GAZ PTP 始终优于所有选定的 GAZ 单人变体。
引用
@article{arxiv.2306.04403,
title = {Policy-Based Self-Competition for Planning Problems},
author = {Jonathan Pirnay and Quirin Göttl and Jakob Burger and Dominik Gerhard Grimm},
journal= {arXiv preprint arXiv:2306.04403},
year = {2023}
}
备注
24 pages, 5 figures