中文

(马尔可夫)势博弈中收敛至 Nash 均衡与无悔保证

计算机科学与博弈论 2024-04-11 v1 机器学习

摘要

在这项工作中,我们研究了随机成本与 bandit 反馈下的势博弈与马尔可夫势博弈。我们提出了一种具有充分探索和递归梯度估计的 Frank-Wolfe 算法变体,该算法可证明收敛至 Nash 均衡,同时为每个个体玩家实现次线性遗憾。我们的算法在势博弈中同时实现了 O(T4/5)O(T^{4/5}) 的 Nash 遗憾与遗憾界,这与现有的最佳结果相匹配,且无需使用额外的投影步骤。通过仔细平衡过去样本的复用与新样本的探索,我们将结果扩展到马尔可夫势博弈,并将现有的最佳 Nash 遗憾从 O(T5/6)O(T^{5/6}) 改进至 O(T4/5)O(T^{4/5})。此外,我们的算法不需要博弈的知识,例如分布失配系数,这在实际实现中提供了更大的灵活性。实验结果证实了我们的理论发现,并强调了我们的方法在实际中的有效性。

关键词

引用

@article{arxiv.2404.06516,
  title  = {Convergence to Nash Equilibrium and No-regret Guarantee in (Markov) Potential Games},
  author = {Jing Dong and Baoxiang Wang and Yaoliang Yu},
  journal= {arXiv preprint arXiv:2404.06516},
  year   = {2024}
}