自适应PSRO:迈向自动化的种群博弈求解器
人工智能
2024-04-18 v1 计算机科学与博弈论
多智能体系统
摘要
策略空间响应或acles(PSRO)作为一种通用算法框架,在学习两人零和博弈的均衡策略方面取得了最先进的性能。然而,现有大多数工作中手工选择的超参数值需要广泛的领域知识,这成为将PSRO应用于不同博弈的主要障碍。在这项工作中,我们首次尝试研究在PSRO框架中自适应确定最优超参数值的可能性。我们的贡献有三方面:(1)使用几个超参数,我们提出了一个参数化PSRO,统一了梯度下降上升(GDA)和不同的PSRO变体。(2)我们通过将参数化PSRO的超参数值选择视为一个超参数优化(HPO)问题,提出了自适应PSRO(SPSRO),其中我们的目标是学习一个HPO策略,该策略可以在参数化PSRO运行期间自适应地确定最优超参数值。(3)为了克服在线HPO方法的性能不佳,我们提出了一种基于Transformer架构的离线HPO方法来优化HPO策略。在各种两人零和博弈上的实验证明了SPSRO相对于不同基线的优越性。
引用
@article{arxiv.2404.11144,
title = {Self-adaptive PSRO: Towards an Automatic Population-based Game Solver},
author = {Pengdeng Li and Shuxin Li and Chang Yang and Xinrun Wang and Xiao Huang and Hau Chan and Bo An},
journal= {arXiv preprint arXiv:2404.11144},
year = {2024}
}
备注
Accepted to 33rd International Joint Conference on Artificial Intelligence (IJCAI 2024)