中文

具有有限多个未知估值的动态定价

机器学习 2019-03-06 v2 机器学习

摘要

受挂牌价格拍卖的启发,其中买方被分为未知数量的潜在类型,由其对出售商品的私有价值表征,我们研究了随机动态定价中的收益最大化问题,其中买方私有价值的分布支撑在 [0,1] 中一个未知基数 KK 的未知点集上。该设定可视为随机 KK 臂老虎机问题的一个实例,其中臂的位置(即 KK 个未知估值)也必须被学习。在无分布情形下,我们证明我们的设定与 KK 臂随机老虎机一样困难:任何算法的后悔值都无法显著优于 KT\sqrt{KT}(其中 T 为时间范围);我们提出了一种高效算法,在对数因子范围内匹配该下界。在有分布情形下,我们证明对所有 K>2K>2,我们的设定严格难于 KK 臂随机老虎机,因为不可能获得随时间对数增长或更慢的后悔界。另一方面,当已知需求曲线最小下降量 γ>0\gamma>0 的下界时,我们证明后悔值的阶为 (1/Δ+(loglogT)/γ2)(KlogT)(1/\Delta+(\log \log T)/\gamma^2)(K\log T) 的上界。这相比先前已知的不连续需求曲线的后悔界(最好为阶 (K12/γ8)T(K^{12}/\gamma^8)\sqrt{T})有显著改进。在有分布情形下当 K=2K=2 时,我们设定的困难度降至随机 22 臂老虎机:我们证明可在对需求曲线无信息的情况下实现阶为 (logT)/Δ(\log T)/\Delta(直至 loglog\log\log 因子)的后悔上界。最后,我们展示了当买方决策为非随机、且后悔值相对于两个固定估值中较好的一个(其中之一为卖方所知)度量时,该设定的 O(T)O(\sqrt{T}) 后悔上界。

关键词

引用

@article{arxiv.1807.03288,
  title  = {Dynamic Pricing with Finitely Many Unknown Valuations},
  author = {Nicolò Cesa-Bianchi and Tommaso Cesari and Vianney Perchet},
  journal= {arXiv preprint arXiv:1807.03288},
  year   = {2019}
}