中文

StratFormer:不完美信息博弈中的自适应对手建模与利用

人工智能 2026-04-29 v1

摘要

我们提出了 StratFormer,一个基于 Transformer 的元智能体,通过两阶段课程学习在不完美信息博弈中同时建模并利用对手。第一阶段训练一个对手建模头,在智能体执行博弈论最优(GTO)策略的同时,从动作历史中识别行为模式。第二阶段在逐对手正则化调度的引导下,逐步将策略转向最佳响应(BR)利用,该调度与可利用度挂钩。我们的架构引入了双回合 token——在智能体与对手决策点共同构建的特征向量——并结合了在五种战略情境下编码对手倾向的桶率特征。在 Leduc Hold'em(一种包含六张牌与两轮下注的小型扑克变体)上,我们针对六种对手原型在两个强度级别上进行测试,其可利用度范围为每手 0.15 至 1.26 大盲注(BB)。StratFormer 在 GTO 基础上实现了平均每手 +0.106 BB 的利用增益,对高度可利用的对手峰值增益达 +0.821,同时保持近均衡安全性。

关键词

引用

@article{arxiv.2604.25796,
  title  = {StratFormer: Adaptive Opponent Modeling and Exploitation in Imperfect-Information Games},
  author = {Andy Caen and Mark H. M. Winands and Dennis J. N. J. Soemers},
  journal= {arXiv preprint arXiv:2604.25796},
  year   = {2026}
}

备注

Accepted at Computers and Games 2026