中文

AlphaZero General 上的超参数扫描

机器学习 2019-03-20 v1 人工智能

摘要

自 AlphaGo 与 AlphaGo Zero 在围棋中取得突破性成功以来,这些程序已被推广以解决其他任务。随后,AlphaZero 被开发用于下围棋、国际象棋与将棋。文献中对这些算法有充分解释。然而,AlphaZero 包含许多参数,且对于 AlphaGo、AlphaGo Zero 与 AlphaZero,都缺乏关于如何设置这些算法中参数值的充分讨论。因此,本文选取 AlphaZero 中的 12 个参数并评估这些参数对训练的贡献。我们关注三个目标(训练损失、时间成本与对弈强度)。对于每个参数,我们使用 3 个不同的值(最小值、默认值、最大值)训练 3 个模型。我们使用 6×6 黑白棋(Othello)对弈,基于 AlphaZeroGeneral 这一 AlphaZero 的开源重实现。总体而言,实验结果表明不同取值会导致不同的训练结果,证明了此类参数扫描的重要性。我们将这 12 个参数划分为时间敏感型参数与时间友好型参数。此外,通过多目标分析,本文为进一步超参数优化提供了有见地的依据。

关键词

引用

@article{arxiv.1903.08129,
  title  = {Hyper-Parameter Sweep on AlphaZero General},
  author = {Hui Wang and Michael Emmerich and Mike Preuss and Aske Plaat},
  journal= {arXiv preprint arXiv:1903.08129},
  year   = {2019}
}

备注

19 pages 13 figures