带背包约束的多项罗吉特_bandit问题:一种近最优算法
机器学习
2024-01-25 v5 数据结构与算法
摘要
我们考虑一个动态 assortment 选择问题,其中卖家拥有 种可替代产品的固定库存,并面对在 个时期内顺序到达的未知需求。在每个时期,卖家需要决定向顾客提供的产品 assortment(满足某些约束)。顾客的响应遵循参数为 的未知多项罗吉特模型(MNL)。如果顾客选择产品 ,卖家获得收益 。卖家的目标是在给定 种产品的固定初始库存下,最大化来自 个顾客的总期望收益。我们提出 MNLwK-UCB,一种基于 UCB 的算法,并刻画了其在不同库存规模情形下的 regret。我们证明当库存规模随时间拟线性增长时,MNLwK-UCB 达到 的 regret 界。我们还证明对于较小的库存(增长为 ,),MNLwK-UCB 达到 。特别地,在长时间范围 上,无论约束和库存规模如何,总是能达到 的速率。
引用
@article{arxiv.2106.01135,
title = {MNL-Bandit with Knapsacks: a near-optimal algorithm},
author = {Abdellah Aznag and Vineet Goyal and Noemie Perivier},
journal= {arXiv preprint arXiv:2106.01135},
year = {2024}
}
备注
Improved the regret bound/assumptions. Corrected the abstract