中文

一般和扩展式博弈中斯塔克伯格均衡近似的双预言采样方法

计算机科学与博弈论 2022-08-16 v1 人工智能

摘要

本文提出了一种在具有不完美信息与完美回忆的一般和序贯博弈中近似强斯塔克伯格均衡的新方法。所提方法具有通用性,因为它不依赖于特定博弈模型的任何特殊性质。该方法基于以下两个阶段的迭代交替:(1) 对跟随者策略空间进行引导式蒙特卡洛树搜索采样;(2) 构建领导者行为策略树,使得所采样的跟随者策略为其最优响应。上述求解方案在三类具有可变特征、在图上进行的拦截博弈中,就领导者的期望效用与时间需求进行了评估。与三种最先进的基于 MILP/LP 的方法相比,在绝大多数测试案例中,所提基于模拟的方法能得出最优的领导者策略,同时在更好的时间可扩展性与更低的内存需求方面优于竞争方法。

关键词

引用

@article{arxiv.1909.03934,
  title  = {Double-oracle sampling method for Stackelberg Equilibrium approximation in general-sum extensive-form games},
  author = {Jan Karwowski and Jacek Mańdziuk},
  journal= {arXiv preprint arXiv:1909.03934},
  year   = {2022}
}