拥塞博弈中赌博机无遗憾动态的多项式收敛
计算机科学与博弈论
2024-01-19 v1
摘要
我们提出了一种赌博机反馈模型下的在线学习算法,一旦拥塞博弈中的所有智能体采用该算法,博弈动态将在关于、智能体数量和可用资源数量的多项式轮数内收敛到-近似纳什均衡。所提出的算法还保证任何采用它的智能体具有次线性遗憾。因此,我们的工作回答了arXiv:2206.01880中的一个开放问题,并将arXiv:2306.15543的最新结果扩展到赌博机反馈模型。此外,我们通过为有向无环图构造精确的1-重心生成器,证明了我们的在线学习算法可以在多项式时间内实现网络拥塞博弈(有向无环图)这一重要特例。
引用
@article{arxiv.2401.09628,
title = {Polynomial Convergence of Bandit No-Regret Dynamics in Congestion Games},
author = {Leello Dadi and Ioannis Panageas and Stratis Skoulakis and Luca Viano and Volkan Cevher},
journal= {arXiv preprint arXiv:2401.09628},
year = {2024}
}