受AlphaZero启发的博弈学习:仅在测试时使用MCTS以实现更快训练
机器学习
2022-09-27 v3 人工智能
计算机科学与博弈论
机器学习
摘要
近来,开创性算法AlphaGo与AlphaZero开启了博弈学习与深度强化学习的新纪元。尽管AlphaGo和AlphaZero的成就——以超人类水平博弈围棋及其他复杂游戏——确实令人惊叹,这些架构的缺陷在于需要高昂的计算资源。许多研究者正在寻找类似AlphaZero但计算需求更低、从而更易复现的方法。本文选取AlphaZero的一个重要元素——蒙特卡洛树搜索(MCTS)规划阶段——并将其与时序差分(TD)学习智能体相结合。我们首次将MCTS包裹于TD n-tuple网络之外,且仅在测试时使用该包裹来创建兼具通用性且同时保持低计算需求的智能体。我们将这一新架构应用于若干复杂游戏(黑白棋、四子连珠、魔方),并展示了这种受AlphaZero启发的MCTS包裹所带来的优势。特别地,我们呈现的结果表明,该智能体是首个在标准硬件(无GPU或TPU)上训练即能击败极强黑白棋程序Edax直至并包括第7级(而多数其他从零学习算法仅能击败至第2级)的智能体。
引用
@article{arxiv.2204.13307,
title = {AlphaZero-Inspired Game Learning: Faster Training by Using MCTS Only at Test Time},
author = {Johannes Scheiermann and Wolfgang Konen},
journal= {arXiv preprint arXiv:2204.13307},
year = {2022}
}
备注
11 pages, 10 figures