中文

对抗性核化多臂老虎机的近最优算法

机器学习 2026-05-29 v2

摘要

本文研究核化多臂老虎机(也称为高斯过程多臂老虎机)在对抗环境中的情况,即在已知的再现性核希尔伯特空间(RKHS)中的奖励函数可能在每个轮次被对手选择。我们证明指数权重算法可实现O~(TγT)\tilde{O}(\sqrt{T \gamma_T})的对抗性后悔,其中TTγT\gamma_T分别表示总轮次数和最大信息增益。对于平方指数(SE)和ν\nu-Mat\'ern核,我们还证明了算法独立的下界,保证了该算法在多对数因子的范围内的最优性。此外,我们 presenting a 使用Nystr"om近似的算法变体,同时保持近似最优的后悔保证。

关键词

引用

@article{arxiv.2605.10299,
  title  = {Nearly-Optimal Algorithm for Adversarial Kernelized Bandits},
  author = {Shogo Iwazaki},
  journal= {arXiv preprint arXiv:2605.10299},
  year   = {2026}
}

备注

47 pages