R-UCB:一种用于风险感知推荐系统的上下文多臂老虎机算法
信息检索
2014-08-12 v1 机器学习
摘要
移动上下文感知推荐系统可以自然地建模为探索/利用权衡(exr/exp)问题,其中系统必须在利用当前知识最大化期望奖励(利用)与了解更多未知用户偏好以改进其知识(探索)之间进行选择。强化学习社区已解决了这一问题,但他们未考虑当前用户情境的风险水平,而在风险水平较高时,推荐用户当前情境下可能不需要的物品可能是危险的。我们在本文中引入了一种名为 R-UCB 的算法,该算法考虑用户情境的风险水平以自适应地平衡 exr 和 exp。对实验结果的详细分析揭示了 exr/exp 行为中的几个重要发现。
引用
@article{arxiv.1408.2195,
title = {R-UCB: a Contextual Bandit Algorithm for Risk-Aware Recommender Systems},
author = {Djallel Bouneffouf},
journal= {arXiv preprint arXiv:1408.2195},
year = {2014}
}