用于计算机围棋的移动网络
人工智能
2020-08-25 v1
摘要
在 Alpha Zero 或 Polygames 等深度强化学习程序中使用的神经网络架构已被证明对所得对弈引擎的性能有重大影响。例如,残差网络的使用使 Alpha Go 的强度提升了 600 ELO。本文提出使用监督学习评估移动网络(Mobile Network)在围棋中的价值,以及使用不同于 Alpha Zero 策略头与价值头的策略头和价值头。我们评估了策略的准确率、价值均方误差、网络随参数数量的效率,以及训练网络的对弈速度和强度。
引用
@article{arxiv.2008.10080,
title = {Mobile Networks for Computer Go},
author = {Tristan Cazenave},
journal= {arXiv preprint arXiv:2008.10080},
year = {2020}
}