AlphaZero 自博弈搜索的预热增强方法
人工智能
2021-01-11 v1 神经与进化计算
摘要
近来,AlphaZero 在深度强化学习中取得了里程碑式成果,其提供的单一自博弈架构以超人类水平学习了三种不同游戏。AlphaZero 是一个具有众多参数的庞大而复杂的系统,其成功需要大量算力与精细调参。在其他游戏中复现结果是一项挑战,许多研究者正寻求在计算需求降低的同时改进结果的方法。AlphaZero 的设计纯粹基于自博弈,不使用标注专家数据或领域特定增强;其设计目标是从零学习。我们提出一种新方法以应对此冷启动问题,即在自博弈训练初始阶段采用简单搜索增强,即 Rollout、快速动作值估计 (RAVE) 及其与神经网络的动态加权组合,以及滚动视界进化算法 (RHEA)。我们的实验表明,这些增强中的大多数在三种不同(小型)棋盘游戏中提升了其基线棋手的性能,其中尤其基于 RAVE 的变体表现强劲。
引用
@article{arxiv.2004.12357,
title = {Warm-Start AlphaZero Self-Play Search Enhancements},
author = {Hui Wang and Mike Preuss and Aske Plaat},
journal= {arXiv preprint arXiv:2004.12357},
year = {2021}
}