带移动成本的 Bandit 与自适应定价
机器学习
2017-02-27 v1 计算机科学与博弈论
摘要
我们将带有单位切换成本的多臂 Bandit 模型进行扩展,以引入动作之间的度量。我们考虑动作上的度量可由一棵完全二叉树建模的情形,两片叶子之间的距离是其最近公共祖先的子树大小,这抽象了动作为连续区间 上的点且切换成本为其距离的情形。在此设置下,我们给出了一种新算法,其确立了 的遗憾界,其中 是动作数量, 是时间跨度。当动作集对应整个 区间时,我们可以将该方法用于具有 Lipschitz 损失函数的 Bandit 学习任务,其中我们的算法实现了 的最优遗憾率,这与无移动惩罚时获得的速率相同。作为主要应用,我们使用新算法来解决自适应定价问题。具体而言,我们考虑单一卖家面对一连串耐心买家的情形。每个买家有一个私人估值和一个他们有兴趣购买的时间窗口,如果窗口内的最低价格低于其估值,他们就会购买。我们证明,通过对价格进行适当的离散化,与事后回顾中的最佳固定价格相比,卖家可以实现 的遗憾界,这优于该问题先前 的遗憾界。
引用
@article{arxiv.1702.07444,
title = {Bandits with Movement Costs and Adaptive Pricing},
author = {Tomer Koren and Roi Livni and Yishay Mansour},
journal= {arXiv preprint arXiv:1702.07444},
year = {2017}
}