中文

具有自强化用户偏好的激励式_bandit学习

机器学习 2021-06-01 v3 机器学习

摘要

在本文中,我们研究了一种新的多臂_bandit(MAB)在线学习模型,该模型考虑了众多推荐系统中的现实现象:(i)学习智能体无法自行拉动臂,因此必须向用户提供奖励以间接激励拉臂;以及(ii)若具有特定臂偏好的用户获得良好奖励,则会产生“自强化”效应,即他们会吸引更多具有相似臂偏好的用户。除了应对探索与利用的权衡外,这一新MAB模型的另一关键特征是平衡奖励与激励支付。智能体的目标是在固定时间范围TT内以较低总支付最大化总奖励。我们在本文中的贡献有两方面:(i)我们提出了一种考虑用户自强化偏好与激励关系的随机臂选择新MAB模型;以及(ii)我们利用多色Polya urn带非线性反馈模型的特性,提出了两种称为“至少-n-探索后提交”和“UCB-List”的MAB策略。我们证明这两种策略在时间范围TT内均实现了O(logT)O(log T)期望遗憾和O(logT)O(log T)期望支付。我们进行数值模拟以展示和验证这两种策略的性能,并研究它们在各种设置下的鲁棒性。

关键词

引用

@article{arxiv.2105.08869,
  title  = {Incentivized Bandit Learning with Self-Reinforcing User Preferences},
  author = {Tianchen Zhou and Jia Liu and Chaosheng Dong and Jingyuan Deng},
  journal= {arXiv preprint arXiv:2105.08869},
  year   = {2021}
}