可实现性下基于回归预言机的带背包上下文老虎机最优算法
机器学习
2023-02-23 v2 机器学习
摘要
我们研究随机带背包上下文老虎机(CBwK)问题,其中在给定上下文下采取每个动作不仅产生随机奖励,还以向量形式消耗随机资源。挑战在于最大化总奖励而不违反每种资源的预算。我们在一般可实现性设定下研究该问题,其中期望奖励与期望成本分别为给定一般函数类 与 中上下文与动作的函數。现有CBwK工作局限于线性函数类,因其使用UCB型算法,严重依赖线性形式,难以推广至一般函数类。受已成功应用于上下文老虎机的在线回归预言机启发,我们提出首个通过归约至在线回归的通用且最优的CBwK算法框架。我们还建立了下界后悔界,以表明我们的算法对多种函数类的最优性。
引用
@article{arxiv.2210.11834,
title = {Optimal Contextual Bandits with Knapsacks under Realizability via Regression Oracles},
author = {Yuxuan Han and Jialin Zeng and Yang Wang and Yang Xiang and Jiheng Zhang},
journal= {arXiv preprint arXiv:2210.11834},
year = {2023}
}
备注
AISTATS2023