中文

存在离群顾客时的鲁棒动态 assortment 优化

机器学习 2022-07-12 v2 机器学习

摘要

我们考虑在具有未知效用参数的多项 logit 模型(MNL)下的动态 assortment 优化问题。本文研究的核心问题是 ε\varepsilon-污染模型下的模型误设,这是鲁棒统计与机器学习中的基本模型。具体而言,在长度为 TT 的销售周期内,我们假设顾客在 (1ε)(1-\varepsilon) 比例的时间段内依据明确指定的底层多项 logit 选择模型购买,而在剩余 ε\varepsilon 比例的时间段内做出任意购买决策。在此模型下,我们通过主动消除策略开发了一种新的鲁棒在线 assortment 优化策略。我们建立了遗憾(regret)的上界与下界,并表明当 assortment 容量为常数时,我们的策略在 TT 的对数因子内是最优的。我们进一步开发了完全自适应策略,无需污染参数 ε\varepsilon 的任何先验知识。在最优与次优产品间存在次优间隙的情况下,我们在已知-ε\varepsilon 与未知-ε\varepsilon 两种情形下均建立了依赖于间隙的对数遗憾上界与下界。我们的仿真研究表明,我们的策略优于基于上置信界(UCB)与 Thompson 采样的现有策略。

关键词

引用

@article{arxiv.1910.04183,
  title  = {Robust Dynamic Assortment Optimization in the Presence of Outlier Customers},
  author = {Xi Chen and Akshay Krishnamurthy and Yining Wang},
  journal= {arXiv preprint arXiv:1910.04183},
  year   = {2022}
}