PokerSkill:LLM 能在无训练或求解器的情况下玩专家水平的扑克
人工智能
2026-05-29 v1 计算机科学与博弈论
摘要
扑克是人工智能的标志性挑战。主导方法依赖于基于反后悔最小化构建的均衡求解器,需要数百万核心小时的训练。大型语言模型 (LLM) 拥有丰富的扑克知识,但在直接询问时表现远低于基于求解器的智能体。传统的基于规则的扑克智能体是可解释且无训练的,但其战略天花板远低于均衡水平。我们引入了 PokerSkill,一个无训练、无求解器的框架,通过将详细的基于规则的扑克技能作为结构化动作-grounding 接口来桥接这一鸿沟。一个确定性的上下文引擎分析当前状态并仅检索来自分层技能库的相关片段,该技能库完全由人类扑克专家设计,限制 LLM 的选择为合理动作。针对 GTOWizard,这是最先进的 GTO 基准,GPT-5.5 XHigh with PokerSkill 实现了 mbb/hand,Claude Opus 4.6 实现了 mbb/hand,Claude Opus 4.7 实现了 mbb/hand,较默认提示基线减少了 49--61% 的损失,并超过强大的 bot Slumbot。我们的关键发现是,仅凭基于规则的技能并不构成强大的策略,LLM 本身也无法玩得好,但二者的组合产生了一个既无训练也无求解器访问 yet 能与建立在数百万核心小时计算上构建的系统竞争的智能体。据我们了解,这是首次展示 LLM 在复杂不完全信息游戏中无游戏特定训练或求解器查询即可实现竞争性能。代码地址为 https://github.com/lbn187/PokerSkill。
引用
@article{arxiv.2605.30094,
title = {PokerSkill: LLMs Can Play Expert-Level Poker without Training or Solvers},
author = {Boning Li and Baoxiang Wang and Longbo Huang},
journal= {arXiv preprint arXiv:2605.30094},
year = {2026}
}
备注
45 pages, 3 figures