中文

面向转化模型的带背包上下文赌博机

机器学习 2022-10-03 v2 机器学习

摘要

我们考虑带背包的上下文赌博机,其中产生的奖励与所承受的成本向量之间存在底层结构。我们的研究动机源于带商业折扣的销售。在每一轮,给定随机独立同分布上下文 xt\mathbf{x}_t 与所选臂 ata_t(例如对应折扣水平),可能获得客户转化;此时获得奖励 r(a,xt)r(a,\mathbf{x}_t) 并承受向量成本 c(at,xt)c(a_t,\mathbf{x}_t)(例如对应收益损失)。否则,若无转化,则奖励与成本均为零。因此,所获得的奖励与成本通过衡量转化与否的二元变量耦合。这种奖励与成本间的底层结构与 Agrawal 和 Devanur [2016] 考虑的线性结构不同(但我们证明本文引入的技术也可应用于这些线性结构的情形)。所给出的自适应策略在每轮基于给定 aax\mathbf{x} 的转化概率的上置信估计求解一个线性规划。此类策略最为自然,并达到了典型阶数 (OPT/BB) T\sqrt{T} 的遗憾界,其中 BB 为允许的总预算,OPT 为静态策略可达成的最优期望奖励,TT 为轮数。

关键词

引用

@article{arxiv.2206.00314,
  title  = {Contextual Bandits with Knapsacks for a Conversion Model},
  author = {Zhen Li and Gilles Stoltz},
  journal= {arXiv preprint arXiv:2206.00314},
  year   = {2022}
}

备注

Thirty-sixth Conference on Neural Information Processing Systems, 2022, New Orleans, United States