中文

超越博弈论最优:针对无限制 Holdem 的盈利最大化扑克智能体

计算机科学与博弈论 2025-09-30 v1 计算与语言

摘要

博弈论在过去几十年中发展为一个主要领域,扑克一直是其关键案例之一。博弈论最优 (GTO) 提供了避免输掉的策略,但纯粹的 GTO 并不保证实现最大利润。为此,我们旨在开发一种超越 GTO 策略的模型,以在无限制 Holdem 中实现利润最大化,包括双人 (two-player) 和多人 (more than two-player) 情况。我们的模型在 GTO 基础上进一步利用对手进行 exploited。该模型首先通过对抗自身的大量模拟扑克手局进行导航,并不断调整决策,直到没有动作能可靠地击败它,形成接近理论最佳策略的强基线。随后,它通过观察对手行为并相应调整策略以捕获额外价值。我们的结果表明,在双人局中,Monte-Carlo Counterfactual Regret Minimization (CFR) 效果最佳,而 CFR 在大多数多人局中仍然是最强方法。通过将 GTO 的防御性优势与实时 exploited 相结合,我们的方法旨�展示如何使扑克智能体从仅仅不输,转变为针对多样化对手持续获胜。

关键词

引用

@article{arxiv.2509.23747,
  title  = {Beyond Game Theory Optimal: Profit-Maximizing Poker Agents for No-Limit Holdem},
  author = {SeungHyun Yi and Seungjun Yi},
  journal= {arXiv preprint arXiv:2509.23747},
  year   = {2025}
}