中文

具有聚合反馈的高斯过程_bandits

机器学习 2021-12-28 v1 机器学习

摘要

我们考虑连续臂_bandits问题,在一种新颖的设置下,于固定预算内基于聚合反馈推荐最佳臂。其动机来自此类应用:精确奖励无法获得或获取代价高昂,而聚合奖励或反馈(如子集上的平均值)是可用的。我们通过假设奖励函数来自高斯过程来约束奖励函数集合,并提出高斯过程乐观优化(GPOO)算法。我们自适应地构造一棵以臂空间子集为节点的树,其中反馈为节点代表点的聚合奖励。我们针对推荐臂上的聚合反馈提出了一种新的简单遗憾概念。我们给出了所提算法的理论分析,并将单点反馈作为特例恢复。我们在模拟数据上展示了 GPOO 并与相关算法进行比较。

关键词

引用

@article{arxiv.2112.13029,
  title  = {Gaussian Process Bandits with Aggregated Feedback},
  author = {Mengyan Zhang and Russell Tsuchida and Cheng Soon Ong},
  journal= {arXiv preprint arXiv:2112.13029},
  year   = {2021}
}

备注

to be published in 36th AAAI Conference on Artificial Intelligence (2022)