中文

带离线数据的在线定价:相变与平方反比律

机器学习 2021-11-18 v7 机器学习

摘要

本文研究在动态定价背景下,已有离线数据对在线学习的影响。我们研究一个单产品在TT个销售周期内的动态定价问题。每个周期的需求由产品价格根据具有未知参数的线性需求模型决定。我们假设在销售周期开始之前,卖家已拥有一些已有的离线数据。该离线数据集包含nn个样本,每个样本是由历史价格及相应需求观测组成的输入输出对。卖家希望利用已有的离线数据和顺序在线数据来最小化在线学习过程的后悔值。我们刻画了离线数据的规模、位置和离散程度对在线学习过程最优后悔值的联合影响。具体而言,离线数据的规模、位置和离散程度分别由历史样本数nn、平均历史价格与最优价格之间的距离δ\delta、以及历史价格的标准差σ\sigma来度量。我们证明最优后悔值为Θ~(TT(nT)δ2+nσ2)\widetilde \Theta\left(\sqrt{T}\wedge \frac{T}{(n\wedge T)\delta^2+n\sigma^2}\right),并基于“面对不确定性保持乐观”原则设计了一种学习算法,其后悔值在最优化意义上仅相差对数因子。我们的结果揭示了最优后悔率随离线数据规模发生的惊人转变,我们称之为相变。此外,我们的结果表明离线数据的位置和离散程度也对最优后悔值有内在影响,并通过平方反比律对该影响进行了量化。

关键词

引用

@article{arxiv.1910.08693,
  title  = {Online Pricing with Offline Data: Phase Transition and Inverse Square Law},
  author = {Jinzhi Bu and David Simchi-Levi and Yunzong Xu},
  journal= {arXiv preprint arXiv:1910.08693},
  year   = {2021}
}

备注

Forthcoming in Management Science