基于自我对弈强化学习和测试时搜索的 Stratego 超人类 AI
机器学习
2025-11-11 v1 人工智能
摘要
少数经典游戏被视为人工智能的重要基准,值得数百万美元的训练成本。其中,Stratego——一种体现隐藏信息下的战略决策挑战的棋盘战争游戏—— stands apart 作为一种需要大规模训练才能达到顶尖人类水平的案例。本工作在性能和成本方面实现了质变,表明不仅可以达到顶尖人类的水平,更能实现远超人类的水平,而且这只需要几千美元的预算。我们通过发展自我对弈强化学习和不完全信息下的测试时搜索的通用方法,实现了这一结果。
引用
@article{arxiv.2511.07312,
title = {Superhuman AI for Stratego Using Self-Play Reinforcement Learning and Test-Time Search},
author = {Samuel Sokota and Eugene Vinitsky and Hengyuan Hu and J. Zico Kolter and Gabriele Farina},
journal= {arXiv preprint arXiv:2511.07312},
year = {2025}
}