用于加速不完美信息博弈中自博弈探索的数据增强博弈起始状态
机器学习
2026-05-15 v1 人工智能
计算机科学与博弈论
多智能体系统
摘要
由于稀疏奖励和长周期内具有挑战性的探索,寻找大规模不完美信息竞争博弈(如 StarCraft、Dota 和 CounterStrike)的近似均衡在计算上仍然不可行。本文提出了一种多智能体起始状态采样策略,旨在显著加速两人零和(2p0s)博弈正则化策略梯度博弈方法中的在线探索。基于熟练人类离线演示能够良好覆盖与均衡博弈相关的高阶策略这一假设,我们提出从离线数据中采样中间状态来初始化强化学习数据收集,以促进对具有策略相关性的子博弈的探索。我们将此方法称为数据增强博弈起始(Data-Augmented Game Starts, DAGS),使用合成数据集以及两人 Kuhn Poker、Goofspiel 和一个旨在惩罚对隐藏信息存在偏置信念的反例博弈的解析可处理长周期控制变体进行了实验。在固定计算预算下,DAGS 使正则化策略梯度方法在探索难度显著更高的博弈中实现了更低的可利用度。我们表明,在求解不完美信息博弈时增强起始状态分布可能导致有偏均衡,并以多任务观测标志的形式提供了一种直接的缓解措施。最后,我们发布了一组新的基准环境,这些环境在保持可利用度度量解析可处理的同时,大幅增加了现有 OpenSpiel 博弈中的探索挑战和状态数量。
引用
@article{arxiv.2605.14379,
title = {Data-Augmented Game Starts for Accelerating Self-Play Exploration in Imperfect Information Games},
author = {JB Lanier and Nathan Monette and Pierre Baldi and Roy Fox},
journal= {arXiv preprint arXiv:2605.14379},
year = {2026}
}
备注
17 pages, 4 figures. JB Lanier and Nathan Monette contributed equally