GTO Wizard 基准测试
人工智能
2026-03-26 v1
摘要
我们介绍了 GTO Wizard 基准测试,这是一个用于评估头盾上限 Texas Hold'em(HUNL)中算法的公共 API 和标准化评估框架。基准测试将代理对抗 GTO Wizard AI,这是一种来自 GTO Wizard 的最先进超人类扑克代理,近似 Nash 均衡。GTO Wizard AI 以 bb/100 的成绩击败了 Slumbot,后者是 2018 年计算机扑克比赛的冠军以及以前最强的公开可访问 HUNL 基准。扑克评估中存在根本性挑战——方差;我们通过集成 AIVAT,这是一种可证明无偏的方差缩减技术,实现了与 naive Monte Carlo 评估相当的统计显著性,只需十倍的手数。我们对最先进的大型语言模型进行了全面的零样本基准测试,包括 GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro、Grok 4 等。初始结果和分析揭示了近年来大语言模型推理能力的显著进步,然而所有模型仍远低于我们基准确立的基准。定性分析揭示了明确的改进机会,包括表征能力以及对隐藏状态的推理能力。该基准为研究人员提供了一个精确且可量化的环境,以评估多智能体系统在部分可观测性下的规划与推理能力的进展。
引用
@article{arxiv.2603.23660,
title = {GTO Wizard Benchmark},
author = {Marc-Antoine Provost and Nejc Ilenic and Christopher Solinas and Philippe Beardsell},
journal= {arXiv preprint arXiv:2603.23660},
year = {2026}
}