高斯过程 bandit 中的改进后悔分析:无噪声奖励、RKHS 范数与非平稳方差的最优性
机器学习
2025-02-11 v1 机器学习
摘要
我们研究高斯过程 (GP) bandit 问题,其目标是在未知奖励函数位于某些再现核希尔伯特空间 (RKHS) 中的情况下最小化后悔。最大后验方差分析在分析近最优 GP bandit 算法(如最大方差减少 (MVR) 和分阶段消除 (PE))中至关重要。因此,我们首先展示了最大后验方差的新型上界,该上界改进了 GP 中噪声方差参数的依赖性。借助此结果,我们改进 MVR 和 PE,以获得 (i) 无噪声情景下的近最优后悔上界,以及 (ii) 相对于奖励函数 RKHS 范数的后悔上界。此外,作为我们提出界的另一应用,我们分析了在时变噪声方差设置下的 GP bandit,这是线性 bandit 具有异方差噪声的核化扩展。对于该问题,我们表明 MVR 和 PE 基于算法实现噪声方差依赖性后悔上界,这与我们的后悔下界相匹配。
引用
@article{arxiv.2502.06363,
title = {Improved Regret Analysis in Gaussian Process Bandits: Optimality for Noiseless Reward, RKHS norm, and Non-Stationary Variance},
author = {Shogo Iwazaki and Shion Takeno},
journal= {arXiv preprint arXiv:2502.06363},
year = {2025}
}
备注
35 pages