用于计算机围棋的多标签价值网络
人工智能
2017-05-31 v1 机器学习
摘要
本文为围棋游戏提出了一种新颖的价值网络架构,称为多标签(ML)价值网络。在多标签价值网络中,针对不同的贴目(一种为平衡先手优势而给予的补偿)设置,同时训练不同的价值(胜率)。多标签价值网络具有三个优点:(a) 它输出不同贴目下的价值,(b) 它支持动态贴目,(c) 它降低了均方误差(MSE)。本文还提出了一种新的动态贴目方法以提高对弈实力。本文还进行了实验以展示该架构的优点。首先,多标签价值网络的均方误差通常低于单一价值网络。其次,基于多标签价值网络的程序以 67.6% 的胜率战胜了基于单一价值网络的程序。第三,采用所提出的动态贴目方法的程序显著提高了对弈实力,尤其是在让子棋中,相较于不使用动态贴目的基线。据我们所知,迄今为止,尚无程序公开使用价值网络进行让子棋对弈。本文为这些程序提供了一种进行让子棋对弈的有效方法。
引用
@article{arxiv.1705.10701,
title = {Multi-Labelled Value Networks for Computer Go},
author = {Ti-Rong Wu and I-Chen Wu and Guan-Wun Chen and Ting-han Wei and Tung-Yi Lai and Hung-Chun Wu and Li-Cheng Lan},
journal= {arXiv preprint arXiv:1705.10701},
year = {2017}
}
备注
This version was also submitted to IEEE TCIAIG on May 30, 2017