面向非平稳环境的加权高斯过程_bandits
机器学习
2022-03-29 v4 人工智能
摘要
本文考虑非平稳环境下的高斯过程(GP)bandit优化问题。为刻画外部变化,黑盒函数允许在再生核希尔伯特空间(RKHS)内随时间变化。为此,我们提出WGP-UCB,一种基于加权高斯过程回归的新型UCB型算法。一个关键挑战是如何处理无限维特征映射。为此,我们利用核近似技术证明了次线性后悔界,这是针对具有一般非线性奖励的加权时变bandits的首个(频率派)次线性后悔保证。该结果推广了非平稳线性bandits与标准GP-UCB算法。此外,我们针对带一般权重的加权高斯过程回归给出了新的浓度不等式。我们还提供了加权最大信息增益的通用上界与依赖于权重的上界。这些结果对于新闻排序与自适应定价等应用具有独立意义,其中权重可用于刻画数据的重要性或质量。最后,我们开展实验以凸显所提算法相较于现有方法在许多情形下的优越增益。
引用
@article{arxiv.2107.02371,
title = {Weighted Gaussian Process Bandits for Non-stationary Environments},
author = {Yuntian Deng and Xingyu Zhou and Baekjin Kim and Ambuj Tewari and Abhishek Gupta and Ness Shroff},
journal= {arXiv preprint arXiv:2107.02371},
year = {2022}
}