中文

Regret Matching+:博弈中的(不)稳定性与快速收敛

计算机科学与博弈论 2023-05-25 v1 机器学习

摘要

Regret Matching+(RM+)及其变体是求解大规模博弈的重要算法。然而,对其在实践中取得成功背后的理论理解仍是一个谜。此外,近期关于博弈中快速收敛的进展仅限于满足稳定性的无遗憾算法,如在线镜像下降。本文中,我们首先给出反例,表明 RM+ 及其预测版本可能是不稳定的,这可能导致其他参与者承受较大的遗憾。随后我们提供两种修正方法:重启以及截断 RM+ 所在的正象限。我们证明,这些修正足以通过带预测的 RM+ 在正规形式博弈中获得 O(T1/4)O(T^{1/4}) 的个体遗憾与 O(1)O(1) 的社会遗憾。我们还将稳定化技术应用于 RM+ 在非耦合学习设定中的先知式更新,并证明了类似于近期关于先知式在线镜像下降工作的理想结果。我们的实验展示了在矩阵博弈与扩展形式博弈中,我们的算法相对于原始基于 RM+ 的算法的优势。

关键词

引用

@article{arxiv.2305.14709,
  title  = {Regret Matching+: (In)Stability and Fast Convergence in Games},
  author = {Gabriele Farina and Julien Grand-Clément and Christian Kroer and Chung-Wei Lee and Haipeng Luo},
  journal= {arXiv preprint arXiv:2305.14709},
  year   = {2023}
}