中文

我们甚至能从最弱者身上学到什么?面向程序化策略的草图学习

人工智能 2022-03-23 v1

摘要

在本文中,我们展示了行为克隆可用于学习程序化策略的有效草图。我们表明,即便是通过克隆弱玩家行为所习得的草图,亦有助于程序化策略的综合。这是因为即便弱玩家也能提供有益信息,例如某玩家必须在游戏轮次中选择一个动作。若不采用行为克隆,综合器即便是最基础的信息也需通过玩游戏来学习,这在计算上可能代价高昂。我们借助模拟退火与 UCT 综合器,实证展示了草图学习方法的优势。我们在 Can't Stop 与 MicroRTS 游戏中评估了我们的综合器。基于草图的综器能够学到比原始对应方法更强的程序化策略。我们的综合器生成了可击败该游戏传统程序化策略的 Can't Stop 策略,并综合出击败最新 MicroRTS 竞赛中表现最佳方法的策略。

关键词

引用

@article{arxiv.2203.11912,
  title  = {What can we Learn Even From the Weakest? Learning Sketches for Programmatic Strategies},
  author = {Leandro C. Medeiros and David S. Aleixo and Levi H. S. Lelis},
  journal= {arXiv preprint arXiv:2203.11912},
  year   = {2022}
}

备注

Published at AAAI'22