中文

AlphaZero 自博弈搜索的预热增强方法

人工智能 2021-01-11 v1 神经与进化计算

摘要

近来,AlphaZero 在深度强化学习中取得了里程碑式成果,其提供的单一自博弈架构以超人类水平学习了三种不同游戏。AlphaZero 是一个具有众多参数的庞大而复杂的系统,其成功需要大量算力与精细调参。在其他游戏中复现结果是一项挑战,许多研究者正寻求在计算需求降低的同时改进结果的方法。AlphaZero 的设计纯粹基于自博弈,不使用标注专家数据或领域特定增强;其设计目标是从零学习。我们提出一种新方法以应对此冷启动问题,即在自博弈训练初始阶段采用简单搜索增强,即 Rollout、快速动作值估计 (RAVE) 及其与神经网络的动态加权组合,以及滚动视界进化算法 (RHEA)。我们的实验表明,这些增强中的大多数在三种不同(小型)棋盘游戏中提升了其基线棋手的性能,其中尤其基于 RAVE 的变体表现强劲。

关键词

引用

@article{arxiv.2004.12357,
  title  = {Warm-Start AlphaZero Self-Play Search Enhancements},
  author = {Hui Wang and Mike Preuss and Aske Plaat},
  journal= {arXiv preprint arXiv:2004.12357},
  year   = {2021}
}