中文

自动强化游戏 AI

人工智能 2016-07-28 v1 计算机科学与博弈论

摘要

人工智能 (AI) 领域近期的一个研究趋势是将多个程序组合成一个单一的、更强的程序;这被称为组合方法。我们在此研究此类方法在游戏程序 (GPPs) 上的应用。此外,我们考虑仅有一个 GPP 可用的情况——通过使用参数甚至简单地使用随机种子将这个单一 GPP 分解为多个 GPP。这些组合方法在学习阶段进行训练。我们提出了两种不同的离线方法。最简单的一种,BestArm,是对种子或参数的直接优化;它对阵原始 GPP 表现相当好,但面对重复游戏并学习的对手时表现不佳。第二种,即 Nash-portfolio,在“单局游戏”测试中表现相似,且面对学习的对手时鲁棒性更强。我们还提出了一种在线学习组合,它反复测试多个 GPP 并逐渐切换到最佳的一个——使用一种赌博机算法。

关键词

引用

@article{arxiv.1607.08100,
  title  = {Automatically Reinforcing a Game AI},
  author = {David L. St-Pierre and Jean-Baptiste Hoock and Jialin Liu and Fabien Teytaud and Olivier Teytaud},
  journal= {arXiv preprint arXiv:1607.08100},
  year   = {2016}
}

备注

17 pages, 31 figures, 2 tables