通过近似相关均衡主动学习在凸游戏中协调
计算机科学与博弈论
2025-09-16 v1
摘要
相关均衡概括了纳什均衡,允许中央协调器通过共享建议指导玩家行为,类似于导航应用指导司机。在我们研究的框架下,协调器可以在每个玩家的成本函数均为凸函数、且依赖于其他玩家的动作、受凸约束且不了解玩家成本函数的情形下,学习相关均衡。我们提出了一种学习框架,通过主动查询玩家的后悔值,即偏离协调器建议所节省的成本。我们首先表明,凸游戏中的相关均衡对应于在无限联合动作空间上最小化所有玩家后悔值的联合动作分布。为使学习问题可计算,我们引入了一个启发式方法,通过最大化它们的两两差异来选择有限数量的代表性联合动作。随后,我们应用贝叶斯优化,通过查询所有玩家的后悔值来学习所选联合动作的概率分布。所学分布通过最小化玩家后悔值来近似相关均衡。我们通过在共享交通网络中的多用户交通分配游戏的数值实验演示了所提出方法。
引用
@article{arxiv.2509.10989,
title = {Actively Learning to Coordinate in Convex Games via Approximate Correlated Equilibrium},
author = {Zhenlong Fang and Aryan Deshwal and Yue Yu},
journal= {arXiv preprint arXiv:2509.10989},
year = {2025}
}