通过步长不对称性实现更快的博弈求解
机器学习
2025-11-14 v2
摘要
反事实后悔最小化 (CFR) 算法广泛用于计算两人零和不完美信息广泛形式博弈中的纳什均衡 (NE)。其中,预测 CFR (PCFR) 因其在许多博弈中通过预测实现了异常快的经验收敛速度而尤为强大。然而,若预测不够准确,PCFR 的经验收敛速度将显著下降,导致在某些不完美信息博弈中表现不稳定。为增强 PCFR 的鲁棒性,本文提出了一种称为非对称 PCFR (APCFR) 的方法,采用隐式累积后悔更新与显式累积后悔更新之间自适应的步长不对称性,以减轻预测不准确对收敛的影响。我们进行了理论分析,阐明了为何 APCFR 能够提升鲁棒性。据我们所知,本文是首次提出步长不对称性这一简单却新颖的技术,有效改进了 PCFR 的鲁棒性。随后,为降低 APCFR 实现的难度,本文提出了一种称为简单 APCFR (SAPCFR) 的简化版本,该版本使用固定的步长不对称性,只需对原始 PCFR 进行一行修改即可实现。实验结果在五个标准不完美信息博弈基准测试和两个针对上限 Texas Hold'em (HUNL) Subagems 上表明:(i) APCFR 和 SAPCFR 在大多数测试博弈中均优于 PCFR;(ii) SAPCFR 在经验收敛速度方面与 APCFR 相当;(iii) 我们的 метод可推广到改进其他 CFR 算法,如折扣 CFR (DCFR)。
引用
@article{arxiv.2503.12770,
title = {Faster Game Solving via Asymmetry of Step Sizes},
author = {Linjian Meng and Tianpei Yang and Youzhi Zhang and Zhenxing Ge and Yang Gao},
journal= {arXiv preprint arXiv:2503.12770},
year = {2025}
}