自适应遗憾最小化中近似广义完全均衡的最后迭代收敛性
计算机科学与博弈论
2025-08-12 v1
摘要
Nash 均衡 (NE) 假设在不完全信息的广义形式游戏 (EFGs) 中的理性博弈,但并不能确保在游戏树的非均衡分支上获得最优策略, potentially 在实际应用中导致次优结果。为此,广义形式完全均衡 (EFPE) 作为 NE 的一种细化,引入受控扰动以模拟潜在的玩家错误。然而,现有的 EFPE 求解算法通常依赖平均策略收敛和固定扰动,面临显著限制:计算平均策略的成本高昂且存在近似误差,而固定扰动则在 NE 近似精度和 NE 细化收敛速率之间存在权衡。为克服这些挑战,我们提出了一种用于计算近似 EFPE 的高效自适应遗憾最小化算法,实现了两人零和 EFG 中的最后迭代收敛。我们的方法引入奖励转换对抗遗憾最小化 (RTCFR) 以求解扰动游戏,并定义一种新度量——信息集 Nash 均衡 (ISNE)——以动态调整扰动。理论分析确认收敛至 EFPE,实验结果表明该方法在 NE 和 EFPE 求解任务中均显著优于最先进的算法。
引用
@article{arxiv.2508.07699,
title = {Last-Iterate Convergence in Adaptive Regret Minimization for Approximate Extensive-Form Perfect Equilibrium},
author = {Hang Ren and Xiaozhen Sun and Tianzi Ma and Jiajia Zhang and Xuan Wang},
journal= {arXiv preprint arXiv:2508.07699},
year = {2025}
}