库存与有限切换约束下的MNL多臂老虎机问题
机器学习
2022-04-25 v1
摘要
优化展示给顾客的产品组合对于线下和线上零售商提升收入都至关重要。为了在探索顾客偏好与利用从数据中学到的顾客选择之间进行权衡,本文采用多项Logit(MNL)选择模型来刻画顾客对产品的选择,研究了在规划周期T内优化产品组合以最大化零售商利润的问题。为使问题设定更贴近实际,我们考虑了库存约束和有限切换约束,即零售商不能在时间T之前耗尽资源库存,且被禁止过于频繁地切换展示给顾客的组合。此类设定适用于在线零售商希望针对一群顾客动态优化组合选择的情形。我们开发了一种高效的类UCB算法,在从数据中学习顾客选择的同时优化组合。我们证明,若允许O(T^α)次切换,我们的算法可达到次线性后悔界Ō(T^{1−α/2})。大量数值实验表明,我们的算法优于基线方法,且其性能与理论上界之间的差距很小。
引用
@article{arxiv.2204.10787,
title = {MNL-Bandits under Inventory and Limited Switches Constraints},
author = {Hongbin Zhang and Yu Yang and Feng Wu and Qixin Zhang},
journal= {arXiv preprint arXiv:2204.10787},
year = {2022}
}