面向带支付的情境_bandit的激励探索与推荐
机器学习
2020-01-23 v1 信息检索
机器学习
摘要
我们提出一种基于情境_bandit的模型,以刻画存在短视用户时某网络平台的学目标与社会福利目标。通过使用支付来激励这些智能体探索不同条目/推荐,我们展示了平台如何学习条目的固有属性,并在最大化累积社会福利的同时实现次线性后悔。我们还计算了平台激励化的累积成本的理论界。不同于该领域以往工作,我们认为情境完全对抗,且对抗者的行为对平台未知。我们的方法可改善电子商务商店、推荐引擎与匹配平台上用户的各类参与度指标。
引用
@article{arxiv.2001.07853,
title = {Incentivising Exploration and Recommendations for Contextual Bandits with Payments},
author = {Priyank Agrawal and Theja Tulabandhula},
journal= {arXiv preprint arXiv:2001.07853},
year = {2020}
}
备注
11 pages, 4 figures