加速围棋中的自我对弈学习
机器学习
2020-11-10 v5 机器学习
摘要
通过对AlphaZero流程和架构引入若干改进,我们极大加速了围棋中的自我对弈学习,相较可比方法实现了50倍的计算量缩减。与AlphaZero及其复现(如ELF OpenGo和Leela Zero)一样,我们的机器人KataGo仅从神经网引导的蒙特卡洛树搜索自我对弈中学习。但AlphaZero需数千TPU耗时数日,ELF需数千GPU耗时两周,而KataGo在少于30块GPU上仅19天便超越ELF的最终模型。大部分加速来自非领域特定的改进,可能直接迁移至其他问题。领域特定技术带来的进一步收益揭示了最佳方法与AlphaZero等纯通用方法间剩余的效率差距。我们的工作是使在如围棋般大状态空间中的学习无需大规模计算资源成为可能的一步。
引用
@article{arxiv.1902.10565,
title = {Accelerating Self-Play Learning in Go},
author = {David J. Wu},
journal= {arXiv preprint arXiv:1902.10565},
year = {2020}
}
备注
28 pages including appendices, 8 figures, 7 tables. Presented at AAAI20-RLG workshop. (this version: updated an email address)