明智选择对手:如何引导程序化策略的综合
机器学习
2023-07-25 v2 人工智能
摘要
本文介绍Local Learner(2L),一种用于提供一组参考策略以引导双人零和博弈中程序化策略搜索的算法。先前的学习算法,如迭代最优响应(IBR)、虚拟博弈(FP)与双预言(DO),可能计算代价高昂或遗漏引导搜索算法的重要信息。2L主动选择一组参考策略以改善搜索信号。我们在三个博弈中引导局部搜索算法综合策略,实证展示了本方法的优势,包括MicroRTS这一具挑战性的实时策略游戏。结果表明,2L学到的参考策略比IBR、FP与DO提供更强的搜索信号。我们还模拟了一场MicroRTS锦标赛,其中使用2L的综合器胜过了最近两届MicroRTS竞赛的冠军——这些均由人类程序员编写的程序化策略。
引用
@article{arxiv.2307.04893,
title = {Choosing Well Your Opponents: How to Guide the Synthesis of Programmatic Strategies},
author = {Rubens O. Moraes and David S. Aleixo and Lucas N. Ferreira and Levi H. S. Lelis},
journal= {arXiv preprint arXiv:2307.04893},
year = {2023}
}
备注
International Joint Conference on Artificial Intelligence (IJCAI) 2023