对抗性核化多臂老虎机的近最优算法
机器学习
2026-05-29 v2
摘要
本文研究核化多臂老虎机(也称为高斯过程多臂老虎机)在对抗环境中的情况,即在已知的再现性核希尔伯特空间(RKHS)中的奖励函数可能在每个轮次被对手选择。我们证明指数权重算法可实现的对抗性后悔,其中和分别表示总轮次数和最大信息增益。对于平方指数(SE)和-Mat\'ern核,我们还证明了算法独立的下界,保证了该算法在多对数因子的范围内的最优性。此外,我们 presenting a 使用Nystr"om近似的算法变体,同时保持近似最优的后悔保证。
关键词
引用
@article{arxiv.2605.10299,
title = {Nearly-Optimal Algorithm for Adversarial Kernelized Bandits},
author = {Shogo Iwazaki},
journal= {arXiv preprint arXiv:2605.10299},
year = {2026}
}
备注
47 pages