中文

R-UCB:一种用于风险感知推荐系统的上下文多臂老虎机算法

信息检索 2014-08-12 v1 机器学习

摘要

移动上下文感知推荐系统可以自然地建模为探索/利用权衡(exr/exp)问题,其中系统必须在利用当前知识最大化期望奖励(利用)与了解更多未知用户偏好以改进其知识(探索)之间进行选择。强化学习社区已解决了这一问题,但他们未考虑当前用户情境的风险水平,而在风险水平较高时,推荐用户当前情境下可能不需要的物品可能是危险的。我们在本文中引入了一种名为 R-UCB 的算法,该算法考虑用户情境的风险水平以自适应地平衡 exr 和 exp。对实验结果的详细分析揭示了 exr/exp 行为中的几个重要发现。

关键词

引用

@article{arxiv.1408.2195,
  title  = {R-UCB: a Contextual Bandit Algorithm for Risk-Aware Recommender Systems},
  author = {Djallel Bouneffouf},
  journal= {arXiv preprint arXiv:1408.2195},
  year   = {2014}
}