中文

大型语言模型距离职业扑克玩家还有多远?基于智能体工具使用的博弈论推理再探讨

人工智能 2026-02-03 v1

摘要

随着大型语言模型(LLM)越来越多地应用于高风险领域,它们在不确定性下进行战略推理的能力变得至关重要。扑克提供了一个严格的测试平台,不仅需要强有力的行动,还需要基于原则的博弈论推理。在本文中,我们对LLM在多个现实扑克任务中进行了系统研究,评估了游戏结果和推理轨迹。我们的分析揭示了LLM无法与传统算法竞争,并识别出三个反复出现的缺陷:依赖启发式方法、事实误解以及行动与推理脱节的“知行差距”。使用行为克隆和逐步强化学习的初步尝试改善了推理风格,但仍不足以实现准确的博弈论玩法。基于这些局限性,我们提出了ToolPoker,一个工具集成的推理框架,它将用于GTO一致行动的外部求解器与更精确的专业风格解释相结合。实验表明,ToolPoker在实现最先进游戏表现的同时,产生的推理轨迹紧密反映了博弈论原理。

关键词

引用

@article{arxiv.2602.00528,
  title  = {How Far Are LLMs from Professional Poker Players? Revisiting Game-Theoretic Reasoning with Agentic Tool Use},
  author = {Minhua Lin and Enyan Dai and Hui Liu and Xianfeng Tang and Yuliang Yan and Zhenwei Dai and Jingying Zeng and Zhiwei Zhang and Fali Wang and Hongcheng Gao and Chen Luo and Xiang Zhang and Qi He and Suhang Wang},
  journal= {arXiv preprint arXiv:2602.00528},
  year   = {2026}
}

备注

Accepted by ICLR 2026