中文

价格保护保证下学习与盈利中的相变

机器学习 2022-11-04 v1 机器学习

摘要

受“价格保护保证”普遍存在的启发——该保证允许在过去购买产品的客户在所谓的价格保护期内(通常定义为购买日期后特定时间窗口)若卖家决定降价则可从卖家处获得退款——我们研究了此类策略对初始未知客户需求的 data-driven 动态定价在线学习算法设计的影响。我们考虑一个企业在 TT 个时间步长内销售产品的设定。针对该设定,我们刻画了价格保护期长度 MM 如何影响学习过程的最优 regret。我们通过首先建立带有新颖 regret 下界实例的基本不可能机制,证明最优 regret 为 Θ~(T+min{M,T2/3})\tilde{\Theta}(\sqrt{T}+\min\{M,\,T^{2/3}\})。随后,我们提出 LEAP,一种用于价格保护下学习与盈利(\underline{L}earning and \underline{EA}rning under \underline{P}rice Protection)的分阶段探索型算法,以对数因子甚至双对数因子(当卖家仅有两种可用价格时)匹配该下界。我们的结果揭示了最优 regret 相对于 MM 的惊人相变。具体而言,当 MM 不太大时,与无价格保护保证的经典设定相比,最优 regret 无显著差异。我们还表明,当 MM 增长很大时,最优 regret 的恶化存在上限。最后,我们进行广泛的数值实验,以展示 LEAP 相对于该问题其他启发式方法的益处。

关键词

引用

@article{arxiv.2211.01798,
  title  = {Phase Transitions in Learning and Earning under Price Protection Guarantee},
  author = {Qing Feng and Ruihao Zhu and Stefanus Jasin},
  journal= {arXiv preprint arXiv:2211.01798},
  year   = {2022}
}