中文

嵌套 Logit 模型下的动态品类选择

机器学习 2021-02-22 v2 机器学习

摘要

我们研究一个在长度为有限 TT 的销售季内的典型动态品类规划问题。在每个时间段,卖家向到达的顾客提供一组可替代产品的品类,顾客根据离散选择模型在所提供的产品中做出购买决策。卖家的目标是最大化期望收益,或等价地,最小化最坏情况期望遗憾。一个关键挑战是产品的效用对卖家未知且需要被学习。尽管动态品类规划问题在收益管理中受到越来越多的关注,现有大多数工作基于多项 logit 选择模型(MNL)。在本文中,我们研究在更一般的选择模型——嵌套 logit 模型下的动态品类规划问题,该模型对分层选择行为建模,并且是“GEV(广义极值)族中使用最广泛的成员”。通过利用每个嵌套内最优品类的收益有序结构,我们开发了一种带有聚合估计方案的新型上置信界(UCB)策略。我们的策略同时学习顾客的选择行为并基于当前知识对品类做出动态决策。它实现的累积遗憾阶为 O~(MNT)\tilde{O}(\sqrt{MNT}),其中 MM 为嵌套数,NN 为每个嵌套中的产品数。我们进一步提供了 Ω(MT)\Omega(\sqrt{MT}) 的下界结果,这表明当 TT 远大于 MMNN 时上界接近最优。当每个嵌套中物品数 NN 较大时,我们进一步提供一种离散化启发式方法以获得我们算法更好的性能。数值结果展示了我们所提算法的经验性能。

关键词

引用

@article{arxiv.1806.10410,
  title  = {Dynamic Assortment Selection under the Nested Logit Models},
  author = {Xi Chen and Chao Shi and Yining Wang and Yuan Zhou},
  journal= {arXiv preprint arXiv:1806.10410},
  year   = {2021}
}

备注

final version