中文

从外部后悔到交换后悔 2.0:大动作空间下的高效归约与遗忘式对手

机器学习 2025-02-25 v4 人工智能 计算机科学与博弈论

摘要

我们提出了一种从交换后悔最小化到外部后悔最小化的新颖归约,它改进了 Blum-Mansour [BM07] 和 Stolz-Lugosi [SL05] 的经典归约,因其不要求动作空间有限。我们表明,只要某假设类存在无外部后悔算法,该类也必存在无交换后悔算法。对于带专家建议的学习问题,我们的结果意味着可以在 log(N)O(1/ϵ)\log(N)^{O(1/\epsilon)} 轮后且每轮复杂度 O(N)O(N) 的情况下保证交换后悔被 {\epsilon} 界定,其中 NN 为专家数量,而 Blum-Mansour 和 Stolz-Lugosi 的经典归约需要 O(N/ϵ2)O(N/\epsilon^2) 轮且每轮复杂度至少 Ω(N2)\Omega(N^2)。我们的结果附带一个相关下界,与 [BM07] 中不同,该下界对遗忘式及 1\ell_1 约束的对手和可采用专家分布的学习器均成立,表明轮数必须为 Ω~(N/ϵ2)\tilde\Omega(N/\epsilon^2) 或关于 1/ϵ1/\epsilon 指数级。我们的归约意味着,若某博弈中可实现无后悔学习,则该博弈必存在近似相关均衡,且近似程度可任意好。这强化了无后悔学习存在近似粗相关均衡的固有推论。重要的是,它为相关均衡的存在性提供了充分条件,大幅放宽了动作集有限的要求,从而回答了 [DG22; Ass+23] 留下的开放问题。此外,它解答了关于博弈中均衡计算与学习的若干悬而未决问题。

关键词

引用

@article{arxiv.2310.19786,
  title  = {From External to Swap Regret 2.0: An Efficient Reduction and Oblivious Adversary for Large Action Spaces},
  author = {Yuval Dagan and Constantinos Daskalakis and Maxwell Fishelson and Noah Golowich},
  journal= {arXiv preprint arXiv:2310.19786},
  year   = {2025}
}