中文

情境多项式 logit 模型的在线与离线最优算法及其在组合与定价中的应用

最优化与控制 2026-04-22 v1

摘要

决定要展示哪些产品以及以何种价格是零售和电子商务运营中的核心决策。在许多应用场景中,这两种选择需在有限的展示容量和不确定的客户需求下联合进行。在本文中,我们研究基于价格依赖情境 multinomial logit 模型下的联合组合与定价问题,其中客户偏好取决于产品特征和售价。我们的分析首先构建了一种新的置信区间,用于在价格依赖特征下进行需求估计。基于此结果,我们开发了一种悲观离线算法和若干类类似SupCB的在线算法,用于联合组合与定价优化。在离线设置下,我们建立了一种以最优组合-价格对附近的局部信息为主导的次优性保证,而非严格依赖对最优动作的精确覆盖。在在线设置中,我们的SupCB类算法将最佳已知的 regret 上界提高到O~(WdTlogN/L0)\widetilde{O}(W\sqrt{dT\log N}/L_0),并提供了一种计算更简便的Thompson抽样替代方案。当我们将其特化为仅进行组合优化或仅进行定价优化时,所得界限恢复了各自领域中已建立的近最小混沌最优率,从而弥合了对组合优化或动态定价成熟研究与其联合优化文献稀缺之间的差距。

关键词

引用

@article{arxiv.2604.19008,
  title  = {Optimal Online and Offline Algorithms for Contextual MNL with Applications to Assortment and Pricing},
  author = {Yunfan Zhang and Yuxuan Han and Hongyu Shan and Jose Blanchet and Zhengyuan Zhou},
  journal= {arXiv preprint arXiv:2604.19008},
  year   = {2026}
}

备注

This is an extended version of the paper "Improved Confidence Regions and Optimal Algorithms for Online and Offline Linear MNL Bandits," accepted to NeurIPS 2025