中文

Poisson-MNL 多臂老虎机:基于决策相关客户到达的近最优动态联合选配与定价

机器学习 2026-02-20 v1 机器学习

摘要

我们研究动态联合选配与定价问题,其中卖方在定期的会计/运营间隔内更新决策,以最大化时间范围内 TT 内的累积每期收入。在许多情境下,选配与价格不仅影响到达客户购买的产品,还影响每个时期内客户的到达数量,而经典的多项比率逻辑(MNL)模型假设到达率为固定值,这可能导致次优决策。我们提出了 Poisson-MNL 模型,将情境 MNL 选择模型与到达率依赖于所提供选配和价格的泊松到达模型耦合。基于该模型,我们开发了基于上置置信界(UCB)思想的高效算法 PMNL。我们通过证明其非渐近 regret 上界为 TlogT\sqrt{T\log{T}} 以及匹配下界(最多相差 logT\log T)来建立其(近)最优性。模拟研究凸显了考虑选配和价格对到达率依赖性的重要性:PMNL 有效学习客户选择和到达模型,提供的联合选配定价决策优于假设固定到达率的其他方法。

关键词

引用

@article{arxiv.2602.16923,
  title  = {Poisson-MNL Bandit: Nearly Optimal Dynamic Joint Assortment and Pricing with Decision-Dependent Customer Arrivals},
  author = {Junhui Cai and Ran Chen and Qitao Huang and Linda Zhao and Wu Zhu},
  journal= {arXiv preprint arXiv:2602.16923},
  year   = {2026}
}