中文

无容量多项 Logit 模型下动态品类规划的最优策略

机器学习 2019-02-11 v2 机器学习

摘要

我们研究了动态品类规划问题,其中对于每位到达的顾客,卖家提供一组可替代产品的品类,顾客根据无容量多项 Logit (MNL) 模型在所提供的产品中进行购买。由于 MNL 的所有效用参数均未知,卖家需要同时学习顾客的选择行为,并基于当前知识对品类做出动态决策。卖家的目标是最大化期望收入,或等价地,最小化期望遗憾。尽管动态品类规划问题在收益管理中受到越来越多的关注,但现有的大多数策略需要估计每个产品的平均效用,且最终遗憾通常涉及产品数量 NN。在最基本且最流行的选择模型——MNL 模型下,动态品类规划问题的最优遗憾仍然是未解的。通过仔细分析收入势函数,我们开发了一种结合自适应置信区间构建的三分搜索策略,实现了 O(T)O(\sqrt{T}) 的与物品无关的遗憾界限,其中 TT 为销售期长度。我们进一步建立了匹配的下界结果,以证明我们策略的最优性。所提出的策略有两个主要优势。首先,我们所有策略的遗憾与 NN 无关。其次,我们的策略几乎无假设:既没有对平均效用的假设,也没有对不同品类期望收入的“可分性”条件假设。我们的结果也扩展了单峰多臂老虎机文献。

关键词

引用

@article{arxiv.1805.04785,
  title  = {An Optimal Policy for Dynamic Assortment Planning Under Uncapacitated Multinomial Logit Models},
  author = {Xi Chen and Yining Wang and Yuan Zhou},
  journal= {arXiv preprint arXiv:1805.04785},
  year   = {2019}
}

备注

29 pages, 1 figure, 1 table. Removed an additional $O(\sqrt{\log\log T})$ term in the regret upper bound from the previous version