中文

带背包约束的多项罗吉特_bandit问题:一种近最优算法

机器学习 2024-01-25 v5 数据结构与算法

摘要

我们考虑一个动态 assortment 选择问题,其中卖家拥有 NN 种可替代产品的固定库存,并面对在 TT 个时期内顺序到达的未知需求。在每个时期,卖家需要决定向顾客提供的产品 assortment(满足某些约束)。顾客的响应遵循参数为 v\boldsymbol{v} 的未知多项罗吉特模型(MNL)。如果顾客选择产品 i[N]i \in [N],卖家获得收益 rir_i。卖家的目标是在给定 NN 种产品的固定初始库存下,最大化来自 TT 个顾客的总期望收益。我们提出 MNLwK-UCB,一种基于 UCB 的算法,并刻画了其在不同库存规模情形下的 regret。我们证明当库存规模随时间拟线性增长时,MNLwK-UCB 达到 O~(N+NT)\tilde{O}(N + \sqrt{NT}) 的 regret 界。我们还证明对于较小的库存(增长为 Tα\sim T^{\alpha}α<1\alpha < 1),MNLwK-UCB 达到 O~(N(1+T1α2)+NT)\tilde{O}(N(1 + T^{\frac{1 - \alpha}{2}}) + \sqrt{NT})。特别地,在长时间范围 TT 上,无论约束和库存规模如何,总是能达到 O~(NT)\tilde{O}(\sqrt{NT}) 的速率。

关键词

引用

@article{arxiv.2106.01135,
  title  = {MNL-Bandit with Knapsacks: a near-optimal algorithm},
  author = {Abdellah Aznag and Vineet Goyal and Noemie Perivier},
  journal= {arXiv preprint arXiv:2106.01135},
  year   = {2024}
}

备注

Improved the regret bound/assumptions. Corrected the abstract