基于后悔信号的AlphaZero搜索控制以提高学习效率
机器学习
2026-02-25 v1 人工智能
摘要
强化学习(RL)代理取得了显著的性能,但仍远不如人类的学习效率。尽管RL代理需要大量自我对弈来提取有用信号,但人类往往只需少数对弈,便能通过反复回顾错误发生的状态而快速进步。这种思想称为搜索控制,旨在从有价值的状态而非始于初始状态的位置开始。AlphaZero的现有工作Go-Exploit即应用了这一思想,通过从自我对弈或搜索树中抽样过去的状态,但它对所有状态的学习潜力一视同仁。我们提出了基于后悔信号的搜索控制(RGSC),该方法为AlphaZero引入后悔网络,以识别代理评估值与实际结果差异最大的高后悔状态。这些状态从自我对弈轨迹和MCTS节点中收集,存储在优先级后悔缓冲区中,并作为新的起始位置重用。在9x9围棋、10x10五子棋和11x11十三国棋中,RGSC相较于AlphaZero和Go-Exploit平均提高了77和89分Elo。当在经过充分训练的9x9围棋模型上训练时,RGSC将对KataGo的胜率从69.3%提高到78.2%,而两项基线方法均未得到改进。这些结果表明,RGSC为搜索控制提供了有效机制,显著提高了AlphaZero训练的效率和鲁棒性。我们的代码已公开:https://rlg.iis.sinica.edu.tw/papers/rgsc
引用
@article{arxiv.2602.20809,
title = {Regret-Guided Search Control for Efficient Learning in AlphaZero},
author = {Yun-Jui Tsai and Wei-Yu Chen and Yan-Ru Ju and Yu-Hung Chang and Ti-Rong Wu},
journal= {arXiv preprint arXiv:2602.20809},
year = {2026}
}
备注
Accepted by the Fourteenth International Conference on Learning Representations (ICLR 2026)