中文

无噪声高斯过程 bandits 中的 Gaussian Process Upper Confidence Bound 实现近最优 regret

机器学习 2025-12-12 v2

摘要

我们研究无噪声高斯过程 (GP) bandits问题,即学习者通过无噪声观测来最小化位于已知再生产核希尔伯特空间 (RKHS) 内的黑盒目标函数的 regret。Gaussian过程上置信界 (GP-UCB) 是已知的 GP-bandits算法,其查询点基于 GP 基于的上置信界得分进行自适应选择。尽管多个现有研究报告了 GP-UCB 在实际中的成功,但当前理论结果表明其性能次优。然而,GP-UCB 在实际表现优于依赖查询点非自适应抽样方案的其他近似最优无噪声算法。本文通过显示无噪声 GP-UCB 实现近最优 regret upper bound 来解决了这一理论与实践性能之间的差距。具体而言,我们的分析表明,在无噪声情形下,平方指数核和具有一定光滑性的 Mat\'ern 核上,GP-UCB 首次实现常数累积 regret。

关键词

引用

@article{arxiv.2502.19006,
  title  = {Gaussian Process Upper Confidence Bound Achieves Nearly-Optimal Regret in Noise-Free Gaussian Process Bandits},
  author = {Shogo Iwazaki},
  journal= {arXiv preprint arXiv:2502.19006},
  year   = {2025}
}

备注

17 pages, NeurIPS 2025