Regret Matching+:博弈中的(不)稳定性与快速收敛
计算机科学与博弈论
2023-05-25 v1 机器学习
摘要
Regret Matching+(RM+)及其变体是求解大规模博弈的重要算法。然而,对其在实践中取得成功背后的理论理解仍是一个谜。此外,近期关于博弈中快速收敛的进展仅限于满足稳定性的无遗憾算法,如在线镜像下降。本文中,我们首先给出反例,表明 RM+ 及其预测版本可能是不稳定的,这可能导致其他参与者承受较大的遗憾。随后我们提供两种修正方法:重启以及截断 RM+ 所在的正象限。我们证明,这些修正足以通过带预测的 RM+ 在正规形式博弈中获得 的个体遗憾与 的社会遗憾。我们还将稳定化技术应用于 RM+ 在非耦合学习设定中的先知式更新,并证明了类似于近期关于先知式在线镜像下降工作的理想结果。我们的实验展示了在矩阵博弈与扩展形式博弈中,我们的算法相对于原始基于 RM+ 的算法的优势。
引用
@article{arxiv.2305.14709,
title = {Regret Matching+: (In)Stability and Fast Convergence in Games},
author = {Gabriele Farina and Julien Grand-Clément and Christian Kroer and Chung-Wei Lee and Haipeng Luo},
journal= {arXiv preprint arXiv:2305.14709},
year = {2023}
}