中文

Stackelberg POMDP:一种用于经济设计的强化学习方法

计算机科学与博弈论 2024-07-22 v4 多智能体系统

摘要

我们引入了一种用于经济设计的强化学习框架,其中环境设计者与参与者之间的交互被建模为Stackelberg博弈。在该博弈中,设计者(领导者)设定经济系统的规则,而参与者(跟随者)进行策略性响应。我们将确定跟随者响应策略的算法集成到领导者的学习环境中,将领导者的学习问题表述为POMDP,我们称之为Stackelberg POMDP。我们证明了在有限的可能策略集合下,Stackelberg博弈中的最优领导者策略是我们Stackelberg POMDP中的最优策略,从而建立了求解POMDP与Stackelberg博弈之间的联系。我们通过集中训练与分散执行框架在有限策略选项下求解我们的POMDP。对于建模为无遗憾学习者的特定跟随者情形,我们求解了一系列日益复杂的设定,包括存在轮流与有限通信的间接机制设计问题。我们通过消融研究证明了我们训练框架的有效性。我们还给出了无遗憾学习者收敛到粗相关均衡的贝叶斯版本的收敛结果,将已知结果推广到相关类型。

关键词

引用

@article{arxiv.2210.03852,
  title  = {Stackelberg POMDP: A Reinforcement Learning Approach for Economic Design},
  author = {Gianluca Brero and Alon Eden and Darshan Chakrabarti and Matthias Gerstgrasser and Amy Greenwald and Vincent Li and David C. Parkes},
  journal= {arXiv preprint arXiv:2210.03852},
  year   = {2024}
}