中文

用于学习游玩 Agar.io 游戏的采样策略梯度

人工智能 2018-09-18 v1

摘要

本文提出一种新的离线 actor-critic 学习算法:采样策略梯度(SPG)。SPG 在动作空间中采样,利用 critic 评估样本以计算近似策略梯度。该采样使 SPG 比确定性策略梯度(DPG)更全局地搜索动作-Q 值空间,从而在理论上能避开更多局部最优。在 Agar.io 游戏的吃豆任务与自对弈环境中,将 SPG 与 Q-learning 及 actor-critic 算法 CACLA、DPG 进行比较。在线游戏 Agar.io 因直观的游戏设计以及能即时与全球玩家竞争而在互联网上极受欢迎。从人工智能角度看,该游戏亦非常引人入胜:游戏具有连续输入与动作空间,并允许具有复杂策略的多样智能体相互竞争。实验结果表明,在吃豆任务中 Q-Learning 与 CACLA 优于预编程的贪婪 bot,但在战斗场景中所有算法均未能超越该 bot。分析显示 SPG 算法通过离线探索具有极强可扩展性,且即便在无需大量采样的基础形式下其性能也与 DPG 相当。

关键词

引用

@article{arxiv.1809.05763,
  title  = {Sampled Policy Gradient for Learning to Play the Game Agar.io},
  author = {Anton Orell Wiehe and Nil Stolt Ansó and Madalina M. Drugan and Marco A. Wiering},
  journal= {arXiv preprint arXiv:1809.05763},
  year   = {2018}
}