使用图卷积网络与 TD($\lambda$) 游玩 Risk 游戏
人工智能
2020-09-15 v1 机器学习
摘要
Risk 是一款六人游戏,具有显著随机性与巨大的博弈树复杂度,这给构建能有效游玩该游戏的智能体带来挑战。以往的 AI 侧重于创建高层手工特征以决定智能体决策。在本项目中,我创建了 D.A.D,一个 Risk 智能体,使用时序差分强化学习训练包含图卷积网络(Graph Convolutional Network)的深度神经网络以评估玩家局势。该网络用于博弈树中选择最优走法。这使得向 AI 中手工注入的知识最小化,确保输入特征尽可能低层,以让网络自行提取有用且复杂的特征,即便网络从随机初始化开始。我还通过引入一种解释攻击走法的新方法(搜索所必需)来解决 Risk 中的非确定性问题。结果是一个在 Lux Delux(Risk 的一个变体)中对比 5 个最佳内置 AI 胜率达 35% 的 AI。
引用
@article{arxiv.2009.06355,
title = {Using Graph Convolutional Networks and TD($\lambda$) to play the game of Risk},
author = {Jamie Carr},
journal= {arXiv preprint arXiv:2009.06355},
year = {2020}
}