改进计算机围棋的模型与搜索
人工智能
2021-04-12 v2
摘要
继Alpha Zero之后,游戏中深度强化学习的标准做法是使用残差网络并通过增加网络深度以获得更好结果。我们提出以改进的移动端网络作为残差网络的替代方案,并通过实验展示了网络根据其宽度与深度所具备的棋力水平。我们还提出了PUCT搜索算法的一种推广,其性能优于PUCT。
引用
@article{arxiv.2102.03467,
title = {Improving Model and Search for Computer Go},
author = {Tristan Cazenave},
journal= {arXiv preprint arXiv:2102.03467},
year = {2021}
}