(马尔可夫)势博弈中收敛至 Nash 均衡与无悔保证
计算机科学与博弈论
2024-04-11 v1 机器学习
摘要
在这项工作中,我们研究了随机成本与 bandit 反馈下的势博弈与马尔可夫势博弈。我们提出了一种具有充分探索和递归梯度估计的 Frank-Wolfe 算法变体,该算法可证明收敛至 Nash 均衡,同时为每个个体玩家实现次线性遗憾。我们的算法在势博弈中同时实现了 的 Nash 遗憾与遗憾界,这与现有的最佳结果相匹配,且无需使用额外的投影步骤。通过仔细平衡过去样本的复用与新样本的探索,我们将结果扩展到马尔可夫势博弈,并将现有的最佳 Nash 遗憾从 改进至 。此外,我们的算法不需要博弈的知识,例如分布失配系数,这在实际实现中提供了更大的灵活性。实验结果证实了我们的理论发现,并强调了我们的方法在实际中的有效性。
引用
@article{arxiv.2404.06516,
title = {Convergence to Nash Equilibrium and No-regret Guarantee in (Markov) Potential Games},
author = {Jing Dong and Baoxiang Wang and Yaoliang Yu},
journal= {arXiv preprint arXiv:2404.06516},
year = {2024}
}