中文

AlphaExploitem:超越纳什均衡的扑克游戏中的利用策略

机器学习 2026-05-12 v1

摘要

扑克是一种不完全信息游戏,长期以来一直是决策在不确定性下的基准。为了在纳什均衡之外最大化效用,智能体可以偏离纳什均衡策略,以利用次优策略的弱点。我们引入 AlphaExploitem,通过层次化Transformer编码器实现对先前游戏手牌的推理,并通过纳入多样化的可被利用对手池来修改训练程序,从而学习利用技巧。在两个不完全信息游戏的标准基准上训练和评估AlphaExploitem。经验上,AlphaExploitem成功地利用了分布内和分布外对手的弱策略,而在对抗纳什均衡对手时仍保持性能。

关键词

引用

@article{arxiv.2605.09150,
  title  = {AlphaExploitem: Going Beyond the Nash Equilibrium in Poker by Learning to Exploit Suboptimal Play},
  author = {Vlad Murgoci and Matthijs Spaan and Yaniv Oren},
  journal= {arXiv preprint arXiv:2605.09150},
  year   = {2026}
}