DecisionHoldem:面向不完美信息博弈的具备多样对手的安全深度受限求解
人工智能
2024-05-29 v2
摘要
不完美信息博弈是一种具有非对称信息的博弈类型。它比完美信息博弈在生活中更常见。近年来,不完美信息博弈(如扑克)中的人工智能(AI)取得了可观的进展与成功。Libratus 和 Deepstack 等超人类扑克 AI 的巨大成功吸引了研究者关注扑克研究。然而,开源代码的缺乏在一定程度上限制了德州扑克 AI 的发展。本文介绍 DecisionHoldem,一种用于单挑无限注德州扑克的高水平 AI,通过考虑对手私有手牌的可能范围进行安全的深度受限子博弈求解,以降低策略的可利用度。实验结果表明,DecisionHoldem 以超过 730 mbb/h(每轮千分之一大盲注)和 700 mbb/h 的优势击败了单挑无限注德州扑克中最强开源可用智能体 Slumbot,以及 Deepstack 的高水平复现版 Openstack。此外,我们发布了 DecisionHoldem 的源代码与工具,以促进不完美信息博弈中 AI 的发展。
引用
@article{arxiv.2201.11580,
title = {DecisionHoldem: Safe Depth-Limited Solving With Diverse Opponents for Imperfect-Information Games},
author = {Qibin Zhou and Dongdong Bai and Junge Zhang and Fuqing Duan and Kaiqi Huang},
journal= {arXiv preprint arXiv:2201.11580},
year = {2024}
}