自动强化游戏 AI
人工智能
2016-07-28 v1 计算机科学与博弈论
摘要
人工智能 (AI) 领域近期的一个研究趋势是将多个程序组合成一个单一的、更强的程序;这被称为组合方法。我们在此研究此类方法在游戏程序 (GPPs) 上的应用。此外,我们考虑仅有一个 GPP 可用的情况——通过使用参数甚至简单地使用随机种子将这个单一 GPP 分解为多个 GPP。这些组合方法在学习阶段进行训练。我们提出了两种不同的离线方法。最简单的一种,BestArm,是对种子或参数的直接优化;它对阵原始 GPP 表现相当好,但面对重复游戏并学习的对手时表现不佳。第二种,即 Nash-portfolio,在“单局游戏”测试中表现相似,且面对学习的对手时鲁棒性更强。我们还提出了一种在线学习组合,它反复测试多个 GPP 并逐渐切换到最佳的一个——使用一种赌博机算法。
引用
@article{arxiv.1607.08100,
title = {Automatically Reinforcing a Game AI},
author = {David L. St-Pierre and Jean-Baptiste Hoock and Jialin Liu and Fabien Teytaud and Olivier Teytaud},
journal= {arXiv preprint arXiv:1607.08100},
year = {2016}
}
备注
17 pages, 31 figures, 2 tables