具有凹奖励和凸背包的多臂老虎机问题
机器学习
2014-02-25 v1
摘要
在本文中,我们考虑了一个非常通用的探索 - 利用权衡模型,该模型允许任意凹奖励和跨时间的凸决策约束,除了对时间范围的常规限制外。该模型涵盖了经典的多臂老虎机 (MAB) 模型以及 Badanidiyuru 等人 [2013] 提出的带背包的老虎机 (BwK) 模型。我们还考虑了该模型的一个扩展,以允许线性上下文,类似于 MAB 模型的线性上下文扩展。我们证明,对 MAB 的 UCB 算法族进行自然且简单的扩展,可为这个更通用的模型提供一个多项式时间算法,该算法具有接近最优的遗憾保证,并与 Badanidiyuru 等人 [2013] 为 BwK 特例提供的界限相匹配,这相当令人惊讶。我们还通过建立该问题与其他研究充分的问题/算法(如 Blackwell 逼近问题、在线凸优化和用于凸优化的 Frank-Wolfe 技术)之间的有趣联系,提供了计算效率更高的算法。我们给出了几个具体应用的例子,其中这种更通用的老虎机模型允许更丰富和/或更高效的问题表述。
引用
@article{arxiv.1402.5758,
title = {Bandits with concave rewards and convex knapsacks},
author = {Shipra Agrawal and Nikhil R. Devanur},
journal= {arXiv preprint arXiv:1402.5758},
year = {2014}
}