中文

具有赌博机反馈的在线博弈去中心化纳什均衡学习

最优化与控制 2022-04-21 v1

摘要

本文研究在线博弈广义纳什均衡的分布式在线赌博机学习,其中所有参与者的代价函数与耦合约束均为时变的。代价与局部约束函数的取值而非完整信息逐步揭示给局部参与者。每个参与者的目标是在无未来信息、受策略集约束和时变耦合不等式约束的条件下自私地最小化自身代价函数。为此,设计了一种基于镜像下降与单点赌博机反馈的分布式在线算法,用于寻求在线博弈的广义纳什均衡。研究表明,若广义纳什均衡序列的路径变化为次线性的,则所设计算法取得次线性期望遗憾与累积约束违背。进一步,将所提算法推广至延迟赌博机反馈场景,即代价与约束函数取值经时间延迟后披露给局部参与者。还证明在路径变化与延迟的一定条件下,带延迟赌博机反馈的在线算法仍具有次线性期望遗憾与累积约束违背。仿真结果说明了理论结果的有效性。

关键词

引用

@article{arxiv.2204.09467,
  title  = {Decentralized Nash Equilibria Learning for Online Game with Bandit Feedback},
  author = {Min Meng and Xiuxian Li and Jie Chen},
  journal= {arXiv preprint arXiv:2204.09467},
  year   = {2022}
}