从外部后悔到交换后悔 2.0:大动作空间下的高效归约与遗忘式对手
机器学习
2025-02-25 v4 人工智能
计算机科学与博弈论
摘要
我们提出了一种从交换后悔最小化到外部后悔最小化的新颖归约,它改进了 Blum-Mansour [BM07] 和 Stolz-Lugosi [SL05] 的经典归约,因其不要求动作空间有限。我们表明,只要某假设类存在无外部后悔算法,该类也必存在无交换后悔算法。对于带专家建议的学习问题,我们的结果意味着可以在 轮后且每轮复杂度 的情况下保证交换后悔被 {\epsilon} 界定,其中 为专家数量,而 Blum-Mansour 和 Stolz-Lugosi 的经典归约需要 轮且每轮复杂度至少 。我们的结果附带一个相关下界,与 [BM07] 中不同,该下界对遗忘式及 约束的对手和可采用专家分布的学习器均成立,表明轮数必须为 或关于 指数级。我们的归约意味着,若某博弈中可实现无后悔学习,则该博弈必存在近似相关均衡,且近似程度可任意好。这强化了无后悔学习存在近似粗相关均衡的固有推论。重要的是,它为相关均衡的存在性提供了充分条件,大幅放宽了动作集有限的要求,从而回答了 [DG22; Ass+23] 留下的开放问题。此外,它解答了关于博弈中均衡计算与学习的若干悬而未决问题。
引用
@article{arxiv.2310.19786,
title = {From External to Swap Regret 2.0: An Efficient Reduction and Oblivious Adversary for Large Action Spaces},
author = {Yuval Dagan and Constantinos Daskalakis and Maxwell Fishelson and Noah Golowich},
journal= {arXiv preprint arXiv:2310.19786},
year = {2025}
}