频繁新品发布的动态学习:一种序列多项 Logit 强盗问题
机器学习
2019-04-30 v1 机器学习
摘要
受企业推出新产品以跟上客户快速变化口味的现象启发,我们考虑一种新颖的在线学习设置,其中利润最大化的卖家需要通过提供推荐来学习客户偏好,推荐中可能包含现有产品以及在销售期中途发布的新产品。我们提出一种序列多项 Logit(SMNL)模型来刻画当产品推荐以分层形式呈现时客户的行为。对于已知客户偏好的离线版本,我们提出一种多项式时间算法并刻画最优分层产品推荐的性质。对于在线问题,我们提出一种学习算法并量化其后悔界。此外,我们将设置扩展以纳入一个约束,该约束保证每个新产品都被学习到给定的精度。我们的结果表明分层结构可用于缓解与学习新产品相关的风险。
引用
@article{arxiv.1904.12445,
title = {Dynamic Learning with Frequent New Product Launches: A Sequential Multinomial Logit Bandit Problem},
author = {Junyu Cao and Wei Sun},
journal= {arXiv preprint arXiv:1904.12445},
year = {2019}
}