中文

利用基于种群的训练加速并改进AlphaZero

人工智能 2020-03-16 v1 机器学习 多智能体系统 神经与进化计算

摘要

AlphaZero在许多博弈中取得了极大成功。遗憾的是,它仍消耗大量计算资源,其中大部分用于自我对弈。超参数调优加剧了训练成本,因为每个超参数配置都需要自身的时间来训练一次运行,在此期间会生成各自的自我对弈记录。因此,不同超参数配置通常需要多次运行。本文提出使用基于种群的训练(PBT)来动态调优超参数并在训练期间提升棋力。另一显著优势是该方法仅需单次运行,且仅产生较小的额外时间开销,因为尽管依据AlphaZero训练算法优化时间有所增加,生成自我对弈记录的时间保持不变。在9x9围棋的实验中,PBT方法相比基线(各自具有超参数配置并单独训练)取得了更高的胜率。对于19x19围棋,借助PBT我们能够获得棋力上的提升。具体而言,PBT智能体对ELF OpenGo(一个使用同等容量神经网络的开源最先进AlphaZero程序)的胜率可达74%。相比之下,饱和的非PBT智能体在相同条件下对ELF OpenGo的胜率为47%。

关键词

引用

@article{arxiv.2003.06212,
  title  = {Accelerating and Improving AlphaZero Using Population Based Training},
  author = {Ti-Rong Wu and Ting-Han Wei and I-Chen Wu},
  journal= {arXiv preprint arXiv:2003.06212},
  year   = {2020}
}

备注

accepted by AAAI2020 as oral presentation. In this version, supplementary materials are added