带背包约束的线性上下文赌博机
机器学习
2016-07-12 v2 最优化与控制
机器学习
摘要
我们考虑除奖励生成外还带有资源消耗的线性上下文赌博机问题。在每一轮中,拉动一个臂的结果是一个奖励以及一个资源消耗向量。这些结果的期望值线性依赖于该臂的上下文。预算/容量约束要求每种资源的总消耗不超过其预算。目标依然是最大化总奖励。该问题被证明是经典线性上下文赌博机 (linContextual)、带背包的赌博机 (BwK) 以及在线随机打包问题 (OSPP) 的一个共同推广。我们为该问题提出了具有近最优遗憾界的算法。我们的界优于该问题非结构化版本的结果,在非结构化版本中,上下文与结果之间的关系可以是任意的,但算法仅与通过优化预言机可访问的一组固定策略竞争。我们以一种非平凡的方式结合了 linContextual、BwK 和 OSPP 研究中的技术,同时解决了这些特例中均不存在的新困难。
引用
@article{arxiv.1507.06738,
title = {Linear Contextual Bandits with Knapsacks},
author = {Shipra Agrawal and Nikhil R. Devanur},
journal= {arXiv preprint arXiv:1507.06738},
year = {2016}
}