中文

弥合差距:一类单产品收益管理问题的边学习边执行算法

机器学习 2013-06-28 v6

摘要

我们考虑一个零售商在有限销售季节内销售一种库存有限的单一产品。客户需求按照泊松过程到达,其速率受零售商采取的单一行动(如价格调整、销售佣金、广告强度等)影响。行动与需求率之间的关系事先未知。然而,零售商能够在根据观察到的需求反应最大化其总期望收益的过程中“实时”学习最优行动。以定价问题为例,我们提出了一种动态的“边学习边执行”算法,该算法仅涉及函数值估计即可实现接近最优的性能。我们的算法采用一系列收缩的价格区间,并使用一组精心选择的参数在该区间内迭代测试价格。我们证明,就渐近“遗憾”(与完全信息最优解相比的相对损失)而言,我们算法的收敛速度是所有可能算法中最快的之一。我们的结果弥合了参数学习和非参数学习之间以及标价机制和客户竞价机制之间的性能差距。本研究的重要管理启示是,关于需求函数参数形式以及每个客户确切保留价格的信息价值,其重要性低于先前文献所暗示的。我们的结果还表明,企业同时进行动态学习和行动比顺序进行更有利。

关键词

引用

@article{arxiv.1101.4681,
  title  = {Close the Gaps: A Learning-while-Doing Algorithm for a Class of Single-Product Revenue Management Problems},
  author = {Zizhuo Wang and Shiming Deng and Yinyu Ye},
  journal= {arXiv preprint arXiv:1101.4681},
  year   = {2013}
}