中文

基于预训练嵌入的不完美信息游戏中的无损策略求解

人工智能 2025-12-10 v2

摘要

高质量的信息集抽象是解决大规模不完美信息广泛形式游戏(IIEFGs)——如无限制德州扑克——的核心挑战,其中空间资源的有限性阻碍了对整个游戏策略的求解。最先进的AI方法依赖于预训练的离散聚类进行抽象,但其硬性分类不可逆地丢弃了关键信息:具体来说,就是信息集合之间的可量化细微差异——对于策略求解至关重要,从而损害了此类求解的质量。受自然语言处理中词嵌入范式的启发,本文提出了Embedding CFR算法,这是一种用于在嵌入空间中求解IIEFGs策略的新方法。算法在预训练后将 individual 信息集合的特征嵌入到 interconnected 的低维连续空间中,其中生成的向量更精确地捕获了信息集合之间的区别和连接。Embedding CFR 引入一种驱动基于后悔积累和策略更新的策略求解过程,旁证其减少累积后悔的能力。在扑克实验中显示,与基于聚类的抽象算法相比,在相同的空间开销下,Embedding CFR 实现了显著更快的可被剥削收敛速度,证明了其有效性。此外,我们在已知方面证明,这是扑克AI中首个通过低维嵌入预训练信息集合抽象进行策略求解的算法。

关键词

引用

@article{arxiv.2511.12083,
  title  = {No-Regret Strategy Solving in Imperfect-Information Games via Pre-Trained Embedding},
  author = {Yanchang Fu and Shengda Liu and Pei Xu and Kaiqi Huang},
  journal= {arXiv preprint arXiv:2511.12083},
  year   = {2025}
}

备注

Accepted to appear at AAAI 2026