用于求解五子棋的UCT-ADP渐进偏置算法
人工智能
2019-12-12 v1
摘要
我们将自适应动态规划(ADP,一种强化学习方法)与应用于树的UCB(UCT)算法相结合,并采用基于渐进偏置(Progressive Bias)方法的更强启发式函数以及两种剪枝策略,用于传统棋盘游戏五子棋。在自适应动态规划部分,我们训练一个浅层前馈神经网络以快速评估五子棋棋盘局势。UCT是MCTS中作为树策略的通用方法。我们的框架使用UCT来平衡五子棋博弈树的探索与利用,同时应用强大的剪枝策略和启发式函数重新选择状态的可用2-邻接格子,并使用ADP代替模拟来给出扩展节点的估计值。实验结果表明,该方法能够消除模拟过程的搜索深度缺陷,并比单一UCT更快地收敛到正确值。该方法可应用于设计新的五子棋AI并求解其他类五子棋的棋盘游戏。
引用
@article{arxiv.1912.05407,
title = {UCT-ADP Progressive Bias Algorithm for Solving Gomoku},
author = {Xu Cao and Yanghao Lin},
journal= {arXiv preprint arXiv:1912.05407},
year = {2019}
}