我们甚至能从最弱者身上学到什么?面向程序化策略的草图学习
人工智能
2022-03-23 v1
摘要
在本文中,我们展示了行为克隆可用于学习程序化策略的有效草图。我们表明,即便是通过克隆弱玩家行为所习得的草图,亦有助于程序化策略的综合。这是因为即便弱玩家也能提供有益信息,例如某玩家必须在游戏轮次中选择一个动作。若不采用行为克隆,综合器即便是最基础的信息也需通过玩游戏来学习,这在计算上可能代价高昂。我们借助模拟退火与 UCT 综合器,实证展示了草图学习方法的优势。我们在 Can't Stop 与 MicroRTS 游戏中评估了我们的综合器。基于草图的综器能够学到比原始对应方法更强的程序化策略。我们的综合器生成了可击败该游戏传统程序化策略的 Can't Stop 策略,并综合出击败最新 MicroRTS 竞赛中表现最佳方法的策略。
引用
@article{arxiv.2203.11912,
title = {What can we Learn Even From the Weakest? Learning Sketches for Programmatic Strategies},
author = {Leandro C. Medeiros and David S. Aleixo and Levi H. S. Lelis},
journal= {arXiv preprint arXiv:2203.11912},
year = {2022}
}
备注
Published at AAAI'22