中文

Conflux-PSRO:在策略空间响应预言机中有效利用集体优势

计算机科学与博弈论 2024-11-14 v2

摘要

策略空间响应预言机(PSRO)结合策略种群构建,已被证明是逼近零和博弈中纳什均衡(NE)的有效方法。现有研究试图通过将多样性正则化纳入最佳响应(BR)来提升策略空间的多样性。然而,这些方法导致BR偏离最大化奖励的目标,容易产生一个重多样性轻性能的种群,即便在多样性并非总是必要的情况下也是如此。因此,在策略被充分探索之前,尤其是在复杂博弈中,可利用性难以降低。本文提出Conflux-PSRO,通过在状态层面自适应地选择和训练策略,充分利用种群的多样性。具体而言,Conflux-PSRO从现有种群中识别出有用的策略,并采用路由策略在每个决策点选择最合适的策略,同时训练它们以提升其有效性。与传统PSRO及其多样性改进变体的单一策略BR相比,Conflux-PSRO生成的BR不仅利用了多样化策略的专业知识,还能协同提升整体性能。我们在多种环境下的实验表明,与现有方法相比,Conflux-PSRO显著提高了BR的效用并降低了可利用性。

关键词

引用

@article{arxiv.2410.22776,
  title  = {Conflux-PSRO: Effectively Leveraging Collective Advantages in Policy Space Response Oracles},
  author = {Yucong Huang and Jiesong Lian and Mingzhi Wang and Chengdong Ma and Ying Wen},
  journal= {arXiv preprint arXiv:2410.22776},
  year   = {2024}
}