中文

通用奖励函数下的非参数贝叶斯优化

机器学习 2026-02-10 v1

摘要

本文聚焦于奖励模型不确定性下的贝叶斯优化(BO)。我们提出首个在通用奖励设置下实现无逝胜 guarantee 的BO算法,仅需目标函数满足Lipschitz连续性,即可适配广泛的测量噪声类型。方法的核心是一种新型代理模型,称为无限高斯过程(infinite Gaussian process,\infty-GP)。它是一种贝叶斯非参数模型,在奖励分布的空间上放置先验,能够表示远超经典高斯过程(GP)的更广泛的奖励模型类别。\infty-GP与Thompson抽样(TS)结合使用,以实现有效的探索与开发。相应地,我们发展了一种新的TS逝胜分析框架,用于通用奖励,将逝胜与代理模型与真实奖励分布之间的总变距离相关联。此外,通过截断Gibbs抽样程序,该方法在计算上具有可扩展性,仅引入极少的额外内存和计算复杂度,媲美经典GP。实验结果表明,方法在非平稳、重尾或其他病态奖励场景下均实现了最先进的性能。

关键词

引用

@article{arxiv.2602.07411,
  title  = {Nonparametric Bayesian Optimization for General Rewards},
  author = {Zishi Zhang and Tao Ren and Yijie Peng},
  journal= {arXiv preprint arXiv:2602.07411},
  year   = {2026}
}