价格保护保证下学习与盈利中的相变
机器学习
2022-11-04 v1 机器学习
摘要
受“价格保护保证”普遍存在的启发——该保证允许在过去购买产品的客户在所谓的价格保护期内(通常定义为购买日期后特定时间窗口)若卖家决定降价则可从卖家处获得退款——我们研究了此类策略对初始未知客户需求的 data-driven 动态定价在线学习算法设计的影响。我们考虑一个企业在 个时间步长内销售产品的设定。针对该设定,我们刻画了价格保护期长度 如何影响学习过程的最优 regret。我们通过首先建立带有新颖 regret 下界实例的基本不可能机制,证明最优 regret 为 。随后,我们提出 LEAP,一种用于价格保护下学习与盈利(\underline{L}earning and \underline{EA}rning under \underline{P}rice Protection)的分阶段探索型算法,以对数因子甚至双对数因子(当卖家仅有两种可用价格时)匹配该下界。我们的结果揭示了最优 regret 相对于 的惊人相变。具体而言,当 不太大时,与无价格保护保证的经典设定相比,最优 regret 无显著差异。我们还表明,当 增长很大时,最优 regret 的恶化存在上限。最后,我们进行广泛的数值实验,以展示 LEAP 相对于该问题其他启发式方法的益处。
引用
@article{arxiv.2211.01798,
title = {Phase Transitions in Learning and Earning under Price Protection Guarantee},
author = {Qing Feng and Ruihao Zhu and Stefanus Jasin},
journal= {arXiv preprint arXiv:2211.01798},
year = {2022}
}