面向转化模型的带背包上下文赌博机
机器学习
2022-10-03 v2 机器学习
摘要
我们考虑带背包的上下文赌博机,其中产生的奖励与所承受的成本向量之间存在底层结构。我们的研究动机源于带商业折扣的销售。在每一轮,给定随机独立同分布上下文 与所选臂 (例如对应折扣水平),可能获得客户转化;此时获得奖励 并承受向量成本 (例如对应收益损失)。否则,若无转化,则奖励与成本均为零。因此,所获得的奖励与成本通过衡量转化与否的二元变量耦合。这种奖励与成本间的底层结构与 Agrawal 和 Devanur [2016] 考虑的线性结构不同(但我们证明本文引入的技术也可应用于这些线性结构的情形)。所给出的自适应策略在每轮基于给定 和 的转化概率的上置信估计求解一个线性规划。此类策略最为自然,并达到了典型阶数 (OPT/) 的遗憾界,其中 为允许的总预算,OPT 为静态策略可达成的最优期望奖励, 为轮数。
引用
@article{arxiv.2206.00314,
title = {Contextual Bandits with Knapsacks for a Conversion Model},
author = {Zhen Li and Gilles Stoltz},
journal= {arXiv preprint arXiv:2206.00314},
year = {2022}
}
备注
Thirty-sixth Conference on Neural Information Processing Systems, 2022, New Orleans, United States