中文

Cournot 博弈中的无后悔学习

计算机科学与博弈论 2020-02-12 v3 多智能体系统 系统与控制 系统与控制 最优化与控制

摘要

本文研究了具有连续行动的 Cournot 博弈中无后悔学习的收敛性。Cournot 博弈是许多社会经济系统的基本模型,其中参与者通过策略性地设定其产量进行竞争。我们假设参与者不具有博弈的完整信息,因此无法预先计算纳什均衡。考虑了两类反馈:一类是 bandit 反馈,另一类是梯度反馈。为研究由此诱导的行动序列的收敛性,我们引入依测度收敛的概念,并证明参与者的实际行动序列收敛到唯一的纳什均衡。此外,我们的结果自然地将无后悔学习算法的时间平均后悔界扩展,从而得到最终迭代的收敛速率。总之,我们的工作在无需对博弈性质(如单调性)做强假设的情况下,给出了博弈中学习显著更锐利的收敛结果,并展示了如何利用博弈信息反馈来影响收敛速率。

关键词

引用

@article{arxiv.1906.06612,
  title  = {No-regret Learning in Cournot Games},
  author = {Yuanyuan Shi and Baosen Zhang},
  journal= {arXiv preprint arXiv:1906.06612},
  year   = {2020}
}