均衡策略泛化:面向掠食-逃避游戏中跨图零样学习的强化学习框架
机器学习
2025-12-15 v2
摘要
对抗性游戏中的均衡学习是博弈论和强化学习(RL)领域广受关注的重要议题。掠食-逃避游戏(PEG)作为来自机器人和安全领域的重要现实游戏类,要求指数级时间才能被精确求解。当底层图结构变化时,即使是最先进的 RL 方法也需要重新计算或至少需要微调,这会耗时且影响实时性。本文提出一种均衡策略泛化(EPG)框架,以有效学习在各种未见图结构下具有鲁健跨图零样性能的泛化策略。在 PEG 的语境中,我们的框架可适用于 pursuer 和 evader 双方在无出口和多出口场景中。据我们所知,这两种泛化属性是该领域首次出现的。EPG 框架的核心思想是跨不同的图结构训练 RL 策略,以对每个单图的均衡策略进行对抗。为构建单图策略的均衡 oracle,我们提出一种动态规划(DP)算法,可在接近最优时间复杂度下 provably 生成纯策略纳什均衡。为保证针对 pursuer 数量的可扩展性,我们进一步设计了分组机制和序列模型,用于联合策略分解。实验结果表明,使用均衡指导和用于跨图 PEG 训练的距离特征,EPG 框架在各种未见现实图上保证了理想的零样性能。此外,在针对带出口图的均衡启发式训练后,我们的泛化 pursuer 策略甚至能匹配最先进 PEG 方法的微调策略性能。
引用
@article{arxiv.2511.00811,
title = {Equilibrium Policy Generalization: A Reinforcement Learning Framework for Cross-Graph Zero-Shot Generalization in Pursuit-Evasion Games},
author = {Runyu Lu and Peng Zhang and Ruochuan Shi and Yuanheng Zhu and Dongbin Zhao and Yang Liu and Dong Wang and Cesare Alippi},
journal= {arXiv preprint arXiv:2511.00811},
year = {2025}
}