中文

Proximal Regret 与 Proximal Correlated Equilibria:面向在线学习与博弈的新可计算解概念

计算机科学与博弈论 2025-11-06 v2 机器学习

摘要

学习与计算博弈论中的均衡是核心问题。本文引入 proximal regret(近似后悔),这是一种基于近端算子(proximal operators)的新型后悔度概念,严格落在外部后悔(external regret)与置换后悔(swap regret)之间。当所有玩家都使用 no-proximal-regret 算法时,经验分布将收敛到 proximal correlated equilibria(近似相关均衡,PCE),这是粗相关均衡(coarse correlated equilibria)的细化。我们的框架统一了若干新兴的在线学习与博弈论概念——如梯度均衡(gradient equilibrium)与半粗相关均衡(semicoarse correlated equilibrium)——并引入了新的概念。我们的主要结果表明,经典的在线梯度下降(Online Gradient Descent,GD)算法可实现对 proximal regret 的最优 O(T)O(\sqrt{T}) 界限,揭示了 GD 在不作任何修改的情况下,最小化的是比外部后悔更强的后悔度。这为梯度下降在在线学习与博弈中经验上优异性能的新解释。我们进一步将分析推广到以 Bregman 量为基础的镜像梯度下降(Mirror Descent)以及乐观梯度下降(Optimistic Gradient Descent),后者在光滑凸博弈中实现更快收敛。

关键词

引用

@article{arxiv.2511.01852,
  title  = {Proximal Regret and Proximal Correlated Equilibria: A New Tractable Solution Concept for Online Learning and Games},
  author = {Yang Cai and Constantinos Daskalakis and Haipeng Luo and Chen-Yu Wei and Weiqiang Zheng},
  journal= {arXiv preprint arXiv:2511.01852},
  year   = {2025}
}

备注

This paper presents proximal regret and proximal correlated equilibria results that do not appear in the NeurIPS version of arXiv:2403.08171