中文

带移动成本的 Bandit 与自适应定价

机器学习 2017-02-27 v1 计算机科学与博弈论

摘要

我们将带有单位切换成本的多臂 Bandit 模型进行扩展,以引入动作之间的度量。我们考虑动作上的度量可由一棵完全二叉树建模的情形,两片叶子之间的距离是其最近公共祖先的子树大小,这抽象了动作为连续区间 [0,1][0,1] 上的点且切换成本为其距离的情形。在此设置下,我们给出了一种新算法,其确立了 O~(kT+T/k)\widetilde{O}(\sqrt{kT} + T/k) 的遗憾界,其中 kk 是动作数量,TT 是时间跨度。当动作集对应整个 [0,1][0,1] 区间时,我们可以将该方法用于具有 Lipschitz 损失函数的 Bandit 学习任务,其中我们的算法实现了 Θ~(T2/3)\widetilde{\Theta}(T^{2/3}) 的最优遗憾率,这与无移动惩罚时获得的速率相同。作为主要应用,我们使用新算法来解决自适应定价问题。具体而言,我们考虑单一卖家面对一连串耐心买家的情形。每个买家有一个私人估值和一个他们有兴趣购买的时间窗口,如果窗口内的最低价格低于其估值,他们就会购买。我们证明,通过对价格进行适当的离散化,与事后回顾中的最佳固定价格相比,卖家可以实现 O~(T2/3)\widetilde{O}(T^{2/3}) 的遗憾界,这优于该问题先前 O~(T3/4)\widetilde{O}(T^{3/4}) 的遗憾界。

关键词

引用

@article{arxiv.1702.07444,
  title  = {Bandits with Movement Costs and Adaptive Pricing},
  author = {Tomer Koren and Roi Livni and Yishay Mansour},
  journal= {arXiv preprint arXiv:1702.07444},
  year   = {2017}
}