可处理性前沿的 $\Phi$-均衡学习与计算
机器学习
2025-12-16 v3 计算机科学与博弈论
机器学习
摘要
-均衡——以及相关的 -遗憾概念——是在线学习和博弈论中强大而灵活的框架,通过丰富偏差集 来获得更强的理性概念。最近,Daskalakis、Farina、Fishelson、Pipis 和 Schneider(STOC '24)——缩写为 DFFPS——在 仅包含线性映射且在一般 维凸约束集 下,确立了高效算法的存在性。本文中,我们通过解决 为 维的情况显著扩展了他们的工作,其中 次多项式构成一个典范例子,。特别地,在仅能访问 的预言机条件下,我们获得了两个主要正面结果:(i) 一个 -时间算法,用于在 玩家多线性博弈中计算 -近似 -均衡,以及 (ii) 一个高效的在线算法,使用 轮迭代实现平均 -遗憾不超过 。我们还展示了在线学习设置中近乎匹配的下界,从而首次获得了一类能够捕捉 -遗憾可学习性的偏差。从技术角度,我们将 DFFPS 的框架从线性映射扩展到更具挑战性的多项式维映射情况。我们的方法核心是基于 Papadimitriou 和 Roughgarden(JACM '08)的椭球与希望(EAH)算法来计算任意 的期望不动点的多项式时间算法。特别地,我们计算 -均衡的算法基于以嵌套方式执行 EAH——EAH 的每一步本身通过调用单独的 EAH 来实现。
引用
@article{arxiv.2502.18582,
title = {Learning and Computation of $\Phi$-Equilibria at the Frontier of Tractability},
author = {Brian Hu Zhang and Ioannis Anagnostides and Emanuel Tewolde and Ratip Emin Berker and Gabriele Farina and Vincent Conitzer and Tuomas Sandholm},
journal= {arXiv preprint arXiv:2502.18582},
year = {2025}
}
备注
V2 makes minor corrections