小型博弈中超参数的分析:自对弈中的迭代次数还是轮次?
机器学习
2020-03-16 v1 人工智能
神经与进化计算
摘要
AlphaGo Zero 的里程碑式成就引发了人们对强化学习中自对弈的巨大研究兴趣。在自对弈中,蒙特卡洛树搜索用于训练深度神经网络,该网络随后用于树搜索。训练本身受许多超参数支配。关于超参数值与损失函数的设计选择研究少得惊人,大概是因为探索参数空间的计算成本过高。本文中,我们研究类 AlphaZero 自对弈算法中的 12 个超参数,并评估这些参数对训练的贡献。我们使用小型博弈,以适度计算代价实现有意义的探索。实验结果表明,训练对超参数选择高度敏感。通过多目标分析,我们识别出 4 个重要超参数作进一步评估。首先,我们发现了令人惊讶的结果:过度训练有时反而导致性能下降。我们的主要结果是,自对弈迭代次数涵盖了 MCTS 搜索模拟、博弈回合与训练轮次。直观而言,这三者随自对弈迭代次数增加而同步增长,而单独增加它们是非最优的。我们实验的一个结论是自对弈中超参数设置的直接建议:应最大化自对弈迭代这一外层循环,而有利于三个内层循环超参数,它们应设为较低值。我们实验的次要结果涉及优化目标的选择,对此我们也提供建议。
引用
@article{arxiv.2003.05988,
title = {Analysis of Hyper-Parameters for Small Games: Iterations or Epochs in Self-Play?},
author = {Hui Wang and Michael Emmerich and Mike Preuss and Aske Plaat},
journal= {arXiv preprint arXiv:2003.05988},
year = {2020}
}