中文

最佳两者: regret 最小化与 minimax 对抗

机器学习 2025-06-05 v2 机器学习

摘要

本文我们研究了在带有 bandit 反馈的在线学习算法中,是否存在同时保证对给定比较策略的 O(1)失误,以及对任何固定策略的O(1)` 失误,以及对任何固定策略的 \tilde{O}(\sqrt{T})` 失误的算法,其中 T为轮数。我们提供了首个肯定回答,仅当比较策略支持每种动作时。对于零和博弈中的normalextensive形式,我们显示我们的结果允许我们保证在风险最多为T` 为轮数。我们提供了首个肯定回答,仅当比较策略支持每种动作时。对于零和博弈中的 normal-和 extensive 形式,我们显示我们的结果允许我们保证在风险最多为 O(1)` 损失的同时,能够从可被利用的对手那里获得 $\Omega(T)` 收益,从而结合 no-regret 算法和 minimax 对抗的优势。

关键词

引用

@article{arxiv.2502.11673,
  title  = {Best of Both Worlds: Regret Minimization versus Minimax Play},
  author = {Adrian Müller and Jon Schneider and Stratis Skoulakis and Luca Viano and Volkan Cevher},
  journal= {arXiv preprint arXiv:2502.11673},
  year   = {2025}
}