具有聚合反馈的高斯过程_bandits
机器学习
2021-12-28 v1 机器学习
摘要
我们考虑连续臂_bandits问题,在一种新颖的设置下,于固定预算内基于聚合反馈推荐最佳臂。其动机来自此类应用:精确奖励无法获得或获取代价高昂,而聚合奖励或反馈(如子集上的平均值)是可用的。我们通过假设奖励函数来自高斯过程来约束奖励函数集合,并提出高斯过程乐观优化(GPOO)算法。我们自适应地构造一棵以臂空间子集为节点的树,其中反馈为节点代表点的聚合奖励。我们针对推荐臂上的聚合反馈提出了一种新的简单遗憾概念。我们给出了所提算法的理论分析,并将单点反馈作为特例恢复。我们在模拟数据上展示了 GPOO 并与相关算法进行比较。
引用
@article{arxiv.2112.13029,
title = {Gaussian Process Bandits with Aggregated Feedback},
author = {Mengyan Zhang and Russell Tsuchida and Cheng Soon Ong},
journal= {arXiv preprint arXiv:2112.13029},
year = {2021}
}
备注
to be published in 36th AAAI Conference on Artificial Intelligence (2022)