中文

非零和博弈中的遗憾最小化及其在构建冠军级多人计算机扑克智能体中的应用

计算机科学与博弈论 2013-05-02 v1 多智能体系统

摘要

在双人零和博弈中,如果双方玩家都最小化其平均外部遗憾,则策略剖面的平均值会收敛到纳什均衡。然而,对于 n 人一般和博弈,遗憾最小化的理论保证尚不明确。尽管如此,Counterfactual Regret Minimization (CFR) 作为一种用于扩展式博弈的流行遗憾最小化算法,已在年度计算机扑克竞赛 (ACPC) 中生成了获胜的三人德州扑克智能体。在本文中,我们通过证明解能消除迭代严格占优,首次提供了非零和博弈中遗憾最小化算法的一组理论性质。我们正式定义了扩展式博弈中的\emph{被占优动作},表明 CFR 避免了迭代严格占优的动作和策略,并证明移除迭代占优动作足以在小型扑克游戏的模拟锦标赛中获胜。此外,对于双人非零和博弈,我们界定了最坏情况下的性能,并表明在实践中,遗憾最小化可以产生非常接近平衡的策略。我们的理论进展促使我们提出了一种针对多于两人博弈的 CFR 新改进版本,该版本效率更高,且可能生成比以往更强的策略。此外,我们展示了一个利用 CFR 和新颖博弈分解方法构建的新三人德州扑克智能体。我们的新智能体赢得了 2012 年 ACPC 的三人赛事,击败了此前竞赛中的获胜三人程序,同时生成所需资源少于 2011 年的获胜者。最后,我们表明,我们的 CFR 改进版本仅需标准 CFR 四分之一的时间和一半的内存,即可计算出与我们新智能体质量相当的策略。

关键词

引用

@article{arxiv.1305.0034,
  title  = {Regret Minimization in Non-Zero-Sum Games with Applications to Building Champion Multiplayer Computer Poker Agents},
  author = {Richard Gibson},
  journal= {arXiv preprint arXiv:1305.0034},
  year   = {2013}
}