中文

通过自主经验回放掌握围棋之谜

人工智能 2026-01-08 v1 机器学习

摘要

围棋作为人工智能的基准测试,长期以来都要求复杂的战略推理和长期规划。AlphaGo 及其后继方法主要依赖于基于模型的蒙特卡罗树搜索(MCTS)。本文提出 QZero,一种新型无模型强化学习算法,放弃训练中的搜索,通过自我对弈和离线经验回放学习纳什均衡策略。基于熵正则化 Q 学习,QZero 使用单个 Q 值网络统一策略评估与改进。从零开始训练,未使用人类数据,仅用 7 块 GPU 的计算资源训练 5 个月,QZero 达到了与 AlphaGo 相当的水平。这首次证明了使用无模型强化学习掌握围棋的效率,以及在大规模复杂环境中实现离线强化学习的可行性。

关键词

引用

@article{arxiv.2601.03306,
  title  = {Mastering the Game of Go with Self-play Experience Replay},
  author = {Jingbin Liu and Xuechun Wang},
  journal= {arXiv preprint arXiv:2601.03306},
  year   = {2026}
}

备注

13 pages, 5 figures