中文

AlphaZero中用于有效策略改进的有针对性搜索控制

人工智能 2023-03-02 v2 机器学习

摘要

AlphaZero是一种自博弈强化学习算法,通过策略迭代在国际象棋、将棋和围棋中实现超人类棋力。要成为有效的策略改进算子,AlphaZero的搜索需要对其搜索树中出现状态的价值进行准确估计。AlphaZero从游戏初始状态开始自博弈对局进行训练,且仅在前几步采样动作,限制了其对游戏树中更深状态的探索。我们引入Go-Exploit,一种用于AlphaZero的新颖搜索控制策略。Go-Exploit从其关注状态档案中采样自博弈轨迹的起始状态。从多样化起始状态开始自博弈轨迹,使Go-Exploit能更有效地探索游戏树,并学习泛化更好的价值函数。生成更短的自博弈轨迹使Go-Exploit能基于更多独立价值目标训练,改善价值训练。最后,Go-Exploit固有的探索减少了其对探索性动作的需求,使其能在更具利用性的策略下训练。在四子连珠和9x9围棋中,我们表明Go-Exploit比标准AlphaZero具有更高的样本效率,从而对参考对手和正面交锋中表现更强。我们还将Go-Exploit与KataGo(一种更高效样本的AlphaZero重实现)比较,并证明Go-Exploit具有更有效的搜索控制策略。此外,当融入KataGo的其他创新时,Go-Exploit的样本效率进一步提升。

关键词

引用

@article{arxiv.2302.12359,
  title  = {Targeted Search Control in AlphaZero for Effective Policy Improvement},
  author = {Alexandre Trudeau and Michael Bowling},
  journal= {arXiv preprint arXiv:2302.12359},
  year   = {2023}
}

备注

This paper has been accepted to the Proceedings of the 22nd International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2023)