中文

报童定价博弈中Stackelberg均衡计算的无遗憾学习

计算工程、金融与科学 2024-10-15 v3 多智能体系统

摘要

我们将在线学习应用于一个由供应商和零售商组成的二元交换网络系统中的Stackelberg博弈,其中需求函数的参数未知。在该博弈中,供应商是先行者,必须确定产品的最优批发价格。随后,作为跟随者的零售商必须确定最优采购量和销售价格。在完全信息设定下,这被称为经典的定价报童问题,我们证明了将其扩展为两人定价博弈时存在唯一的Stackelberg均衡。在在线学习框架下,跟随者和领导者的奖励函数参数都必须被学习,假设跟随者会在不确定性下以乐观态度做出最优响应。我们使用一种基于可测量不确定性集的上下文线性bandit新算法,为随机需求参数提供置信界。由此,我们给出了Stackelberg遗憾的最优有限时间遗憾界,以及收敛到近似Stackelberg均衡的保证。

关键词

引用

@article{arxiv.2404.00203,
  title  = {No-Regret Learning for Stackelberg Equilibrium Computation in Newsvendor Pricing Games},
  author = {Larkin Liu and Yuming Rong},
  journal= {arXiv preprint arXiv:2404.00203},
  year   = {2024}
}

备注

Stackelberg Games, Online Learning, Dynamic Pricing