不完美信息情景下的自我对弈强化学习中GAE的局限性
机器学习
2026-05-20 v1 计算机科学与博弈论
摘要
在不完美信息游戏中进行竞争性多智能体强化学习需要在部分可观测性和对抗性对手的约束下行动,因而需要使用随机策略。虽然基于近端策略优化(PPO)的自我对弈强化学习已在实证上取得强劲成功,但其标准优势估计器——广义优势估计(GAE)由于对随机未来动作的抽样,导致额外方差。这种方差在均衡自我对弈中被放大,由于均衡策略的随机性,即使批评家恰好也持续存在。我们通过引入基于集中式动作价值批评家的Q增强(Q-boosting)来消除方差,并提出Variance-Reduced Policy Optimization(VRPO),集成了这一新型估计器。该算法将抽样的多步骤备份替换为多步骤Expected SARSA(λ)轨迹,在每一步计算策略期望,以平均消除动作抽样噪声,同时保留PPO的裁剪目标和基于策略的演员更新。实证上,VRPO在包括豆抓庄和头盾无限制德州扑克等从中等规模到大规模游戏中均稳健地实现了强劲性能。
引用
@article{arxiv.2605.19235,
title = {GAE Falls Short in Imperfect-Information Self-Play Reinforcement Learning},
author = {Zhiyuan Fan and Gabriele Farina},
journal= {arXiv preprint arXiv:2605.19235},
year = {2026}
}