AlphaExploitem:超越纳什均衡的扑克游戏中的利用策略
机器学习
2026-05-12 v1
摘要
扑克是一种不完全信息游戏,长期以来一直是决策在不确定性下的基准。为了在纳什均衡之外最大化效用,智能体可以偏离纳什均衡策略,以利用次优策略的弱点。我们引入 AlphaExploitem,通过层次化Transformer编码器实现对先前游戏手牌的推理,并通过纳入多样化的可被利用对手池来修改训练程序,从而学习利用技巧。在两个不完全信息游戏的标准基准上训练和评估AlphaExploitem。经验上,AlphaExploitem成功地利用了分布内和分布外对手的弱策略,而在对抗纳什均衡对手时仍保持性能。
引用
@article{arxiv.2605.09150,
title = {AlphaExploitem: Going Beyond the Nash Equilibrium in Poker by Learning to Exploit Suboptimal Play},
author = {Vlad Murgoci and Matthijs Spaan and Yaniv Oren},
journal= {arXiv preprint arXiv:2605.09150},
year = {2026}
}