Fusion-PSRO:用于策略空间响应或acles的纳什策略融合
计算机科学与博弈论
2026-01-06 v6 人工智能
机器学习
多智能体系统
摘要
为解决涉及非传递性的零和博弈,一种有效的方法是维护一个策略种群来近似纳什均衡(NE)。先前的研究表明,策略空间响应或acles(PSRO)算法是解决此类博弈的有效框架。然而,当前方法在最佳响应(BR)中从头初始化新策略或继承单一历史策略,错失了利用过往策略生成更优BR的机会。在本文中,我们提出Fusion-PSRO,它采用纳什策略融合来为BR训练初始化新策略。纳什策略融合作为一种隐式引导策略,在当前元纳什均衡上开始探索,从而提供更接近BR的近似。此外,它巧妙地捕捉了过往策略的加权移动平均,并在每次迭代中基于元纳什均衡动态调整这些权重。这一累积过程进一步增强了策略种群。在经典基准测试上的实证结果表明,Fusion-PSRO实现了更低的可剥削性,从而弥补了先前在BR中关于策略初始化研究的不足。
引用
@article{arxiv.2405.21027,
title = {Fusion-PSRO: Nash Policy Fusion for Policy Space Response Oracles},
author = {Jiesong Lian and Yucong Huang and Chengdong Ma and Mingzhi Wang and Ying Wen and Long Hu and Yixue Hao},
journal= {arXiv preprint arXiv:2405.21027},
year = {2026}
}
备注
Accepted by ECAI 2025