中文

面向带支付的情境_bandit的激励探索与推荐

机器学习 2020-01-23 v1 信息检索 机器学习

摘要

我们提出一种基于情境_bandit的模型,以刻画存在短视用户时某网络平台的学目标与社会福利目标。通过使用支付来激励这些智能体探索不同条目/推荐,我们展示了平台如何学习条目的固有属性,并在最大化累积社会福利的同时实现次线性后悔。我们还计算了平台激励化的累积成本的理论界。不同于该领域以往工作,我们认为情境完全对抗,且对抗者的行为对平台未知。我们的方法可改善电子商务商店、推荐引擎与匹配平台上用户的各类参与度指标。

关键词

引用

@article{arxiv.2001.07853,
  title  = {Incentivising Exploration and Recommendations for Contextual Bandits with Payments},
  author = {Priyank Agrawal and Theja Tulabandhula},
  journal= {arXiv preprint arXiv:2001.07853},
  year   = {2020}
}

备注

11 pages, 4 figures