中文

频繁新品发布的动态学习:一种序列多项 Logit 强盗问题

机器学习 2019-04-30 v1 机器学习

摘要

受企业推出新产品以跟上客户快速变化口味的现象启发,我们考虑一种新颖的在线学习设置,其中利润最大化的卖家需要通过提供推荐来学习客户偏好,推荐中可能包含现有产品以及在销售期中途发布的新产品。我们提出一种序列多项 Logit(SMNL)模型来刻画当产品推荐以分层形式呈现时客户的行为。对于已知客户偏好的离线版本,我们提出一种多项式时间算法并刻画最优分层产品推荐的性质。对于在线问题,我们提出一种学习算法并量化其后悔界。此外,我们将设置扩展以纳入一个约束,该约束保证每个新产品都被学习到给定的精度。我们的结果表明分层结构可用于缓解与学习新产品相关的风险。

关键词

引用

@article{arxiv.1904.12445,
  title  = {Dynamic Learning with Frequent New Product Launches: A Sequential Multinomial Logit Bandit Problem},
  author = {Junyu Cao and Wei Sun},
  journal= {arXiv preprint arXiv:1904.12445},
  year   = {2019}
}