最佳两者: regret 最小化与 minimax 对抗
机器学习
2025-06-05 v2 机器学习
摘要
本文我们研究了在带有 bandit 反馈的在线学习算法中,是否存在同时保证对给定比较策略的 \tilde{O}(\sqrt{T})` 失误的算法,其中 O(1)` 损失的同时,能够从可被利用的对手那里获得 $\Omega(T)` 收益,从而结合 no-regret 算法和 minimax 对抗的优势。
引用
@article{arxiv.2502.11673,
title = {Best of Both Worlds: Regret Minimization versus Minimax Play},
author = {Adrian Müller and Jon Schneider and Stratis Skoulakis and Luca Viano and Volkan Cevher},
journal= {arXiv preprint arXiv:2502.11673},
year = {2025}
}