中文

零和博弈中快速而稳健的对称学习:梯度下降作为虚假博弈

机器学习 2025-06-17 v1 计算机科学与博弈论

摘要

本文研究了两种非亏损算法在零和博弈中的次线性懊悔保证:虚假博弈 (Fictitious Play) 和带常数步长的在线梯度下降 (Online Gradient Descent)。在一般对抗性在线学习环境中,这两种算法可能因缺乏正则化(虚假博弈)或正则化量不足(梯度下降)而出现不稳定现象并产生线性懊悔。然而,它们在两人零和博弈中获得更紧致懊悔界的能力尚不明了。本文在一类广义的对称零和博弈上获得了强大的新型懊悔保证,这类博弈将经典的三策略石头-剪刀-布扩展为加权的 n 维方案。在玩家策略的对称初始化下,我们证明任何 tiebreaking 规则的虚假博弈具有 O(T)O(\sqrt{T}) 的懊悔,确立了 Karlin 虚假博弈猜想成立的新型博弈类。此外,通过揭示虚假博弈和梯度下降在 payoff 向量对偶空间中迭代几何之间的联系,我们证明梯度下降在几乎所有对称初始化下,当其步长为足够大的常数时,也能获得类似的 O(T)O(\sqrt{T}) 懊悔界。对于梯度下降,这建立了在大于 2x2 的零和博弈中实现“快速而稳健”行为(即无需随时间衰减的步长即可获得次线性懊悔)的首个例子。

关键词

引用

@article{arxiv.2506.13086,
  title  = {Fast and Furious Symmetric Learning in Zero-Sum Games: Gradient Descent as Fictitious Play},
  author = {John Lazarsfeld and Georgios Piliouras and Ryann Sim and Andre Wibisono},
  journal= {arXiv preprint arXiv:2506.13086},
  year   = {2025}
}

备注

COLT 2025